rwlinno/topoprm-ckpts
Document latest merged Full release and preserve legacy checkpoint scope
Add completed TopoPRM Full TGD seed-123 merged checkpoint
Upload folder using huggingface_hub
Update repo README with model card
Add grpo-scae-qwen35-9b (Qwen3.5-9B, GRPO+SCAE, step 949, LoRA r=64 alpha=128)
Add opd-topoprm-qwen35-9b-v2 (Qwen3.5-9B, OPD Stage3, step 50, LoRA r=64 alpha=128)
Add opd-topoprm-dr1-7b-v2 (DR1-7B, OPD Stage3, step 200, LoRA r=64 alpha=128)
Add grpo-topoprm-qwen35-9b (Qwen3.5-9B, GRPO+TopoPRM, step 50, LoRA r=64 alpha=128)
Add grpo-topoprm-dr1-7b (DR1-7B, GRPO+TopoPRM, step 100, LoRA r=64 alpha=128)
Add sft-dr1-7b-final checkpoint
Upload folder using huggingface_hub
Upload folder using huggingface_hub
Upload folder using huggingface_hub
Upload folder using huggingface_hub
Upload folder using huggingface_hub
Upload folder using huggingface_hub
Upload folder using huggingface_hub
Upload grpo_hier_9b_ckpt79/args.json
Upload grpo_hier_9b_ckpt79/additional_config.json
Upload grpo_hier_9b_ckpt79/scheduler.pt
Upload grpo_hier_9b_ckpt79/adapter_config.json
Upload grpo_hier_9b_ckpt79/rng_state.pth
Upload grpo_hier_9b_ckpt79/adapter_model.safetensors
Upload grpo_hier_9b_ckpt79/training_args.bin
Upload grpo_hier_9b_ckpt79/trainer_state.json
Upload grpo_hier_9b_ckpt79/optimizer.pt
Upload grpo_topoprm_dr1_7b_ckpt949/args.json
Upload grpo_topoprm_dr1_7b_ckpt949/additional_config.json
Upload grpo_topoprm_dr1_7b_ckpt949/adapter_config.json
Upload grpo_topoprm_dr1_7b_ckpt949/scheduler.pt
Upload grpo_topoprm_dr1_7b_ckpt949/training_args.bin
Upload grpo_topoprm_dr1_7b_ckpt949/rng_state.pth
Upload grpo_topoprm_dr1_7b_ckpt949/adapter_model.safetensors
Upload opd_dr1_7b_stage3_v2_ckpt200/trainer_state.json
Upload opd_dr1_7b_stage3_v2_ckpt200/optimizer.pt
Upload opd_dr1_7b_stage3_v2_ckpt200/args.json
Upload opd_dr1_7b_stage3_v2_ckpt200/additional_config.json
Upload opd_dr1_7b_stage3_v2_ckpt200/adapter_config.json
Upload opd_dr1_7b_stage3_v2_ckpt200/scheduler.pt
Upload opd_dr1_7b_stage3_v2_ckpt200/training_args.bin
Upload opd_dr1_7b_stage3_v2_ckpt200/rng_state.pth
Upload opd_dr1_7b_stage3_v2_ckpt200/adapter_model.safetensors
Upload opd_dr1_7b_stage3_ckpt200/trainer_state.json
Upload opd_dr1_7b_stage3_ckpt200/optimizer.pt
Upload opd_dr1_7b_stage3_ckpt200/args.json
Upload opd_dr1_7b_stage3_ckpt200/additional_config.json
Upload opd_dr1_7b_stage3_ckpt200/adapter_config.json
Upload opd_dr1_7b_stage3_ckpt200/scheduler.pt
Upload opd_dr1_7b_stage3_ckpt200/training_args.bin
Upload opd_dr1_7b_stage3_ckpt200/rng_state.pth
