phuctahong/nanogpt-gpt-mha-falcon-1a-scaled-ctxeta-ctxlambda-chunk-triton-379m-job11173485-step100000
057
phuctahong/nanogpt-gpt-mha-falcon-1a-scaled-ctxeta-ctxlambda-chunk-triton-379m-job11173485-step100000
NanoGPT Pro checkpoint uploaded from the princeton-pli/Nanogpt W&B project.
Provenance
- W&B run: M_gpt-mha-falcon-1A-scaled-ctxeta-ctxlambda-chunk-triton_379m_Opt_adamw_LR_0.001_D_fineweb-edu100B_T_49.15B_time_20260721_040734_jobid_11173485
- W&B run id:
cgxkbx32 - Job id:
11173485 - Checkpoint step:
100000 - Local checkpoint:
/scratch/gpfs/JHACKL/nanogpt-next_mod/output/out_gpt-mha-falcon-1A-scaled-ctxeta-ctxlambda-chunk-triton_379m_Opt_adamw_LR_0.001_D_fineweb-edu100B_T_49.15B_time_20260721_040734_jobid_11173485/checkpoint-100000
Files
This repo contains inference-ready weights only:
config.jsonmodel.safetensorsgeneration_config.json
Optimizer and trainer state were intentionally omitted.
Load locally
from nanogptpro.model_loader import load_model_from_checkpoint
model = load_model_from_checkpoint(
model_id="<your-model-id>",
checkpoint="phuctahong/nanogpt-gpt-mha-falcon-1a-scaled-ctxeta-ctxlambda-chunk-triton-379m-job11173485-step100000",
)Install nanogptpro and use the model id that matches the architecture recorded in config.json.
