phuctahong/nanogpt-gpt-mha-falcon-1a-ctxeta-ctxlambda-chunk-triton-379m-job12802717-step100000
043
phuctahong/nanogpt-gpt-mha-falcon-1a-ctxeta-ctxlambda-chunk-triton-379m-job12802717-step100000
NanoGPT Pro checkpoint uploaded from the princeton-pli/Nanogpt W&B project.
Provenance
- W&B run: M_gpt-mha-falcon-1A-ctxeta-ctxlambda-chunk-triton_379m_Opt_adamw_LR_0.001_D_fineweb-edu100B_T_49.15B_time_20260823_060414_jobid_12802717
- W&B run id:
oke9qea6 - Job id:
12802717 - Checkpoint step:
100000 - Local checkpoint:
/scratch/gpfs/JHACKL/nanogpt-next_mod/output/falcon_lambda_challengers/f1a2_l001_025/out_gpt-mha-falcon-1A-ctxeta-ctxlambda-chunk-triton_379m_Opt_adamw_LR_0.001_D_fineweb-edu100B_T_49.15B_time_20260823_060414_jobid_12802717/checkpoint-100000
Files
This repo contains inference-ready weights only:
config.jsonmodel.safetensorsgeneration_config.json
Optimizer and trainer state were intentionally omitted.
Load locally
from nanogptpro.model_loader import load_model_from_checkpoint
model = load_model_from_checkpoint(
model_id="<your-model-id>",
checkpoint="phuctahong/nanogpt-gpt-mha-falcon-1a-ctxeta-ctxlambda-chunk-triton-379m-job12802717-step100000",
)Install nanogptpro and use the model id that matches the architecture recorded in config.json.
