MooreMuaMu/ancient-rl-grpo-pilot3-step50
05
Ancient Language GRPO — Pilot 3 Step 50
最均衡的 RL checkpoint:10 个 bucket 中 8 个涨点。
模型信息
- 基座模型: Qwen3-14B (zisuh/round2-10lang-passk-15k-sft-0608 checkpoint-195-merged)
- 训练方法: GRPO (Group Relative Policy Optimization) + LoRA rank=64
- Reward: BLEU-2 + BERTScore (batched)
- 训练步数: 50 / 300 (此 checkpoint 在 step 50 保存)
- 超参数: gen=16, temp=1.0, β=0.01, lr=2e-6, constant scheduler
训练 Bucket (10 个)
总训练数据: 60,606 samples (每 bucket ≤ 10,000,均衡采样)
评测结果 (sacrebleu sentence-BLEU-2, 0-100)
在 testfinalnew 上评测 (50 samples/bucket, n=8, temp=0.7):
使用方式
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("MooreMuaMu/ancient-rl-grpo-pilot3-step50", torch_dtype="bfloat16", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("MooreMuaMu/ancient-rl-grpo-pilot3-step50")关键发现
- β=0.01 让翻译任务获得了涨点(β=0.02 时翻译无改善)
- Step 50 是多数 bucket 的最优 checkpoint,说明早期学习最有效
- 数据均衡(每 bucket ≤ 10k)防止了大 bucket 主导训练
