CoolFace
Modelpublic

MooreMuaMu/ancient-rl-grpo-pilot3-step50

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes5downloads
Model Card

Ancient Language GRPO — Pilot 3 Step 50

最均衡的 RL checkpoint:10 个 bucket 中 8 个涨点。

模型信息

  • 基座模型: Qwen3-14B (zisuh/round2-10lang-passk-15k-sft-0608 checkpoint-195-merged)
  • 训练方法: GRPO (Group Relative Policy Optimization) + LoRA rank=64
  • Reward: BLEU-2 + BERTScore (batched)
  • 训练步数: 50 / 300 (此 checkpoint 在 step 50 保存)
  • 超参数: gen=16, temp=1.0, β=0.01, lr=2e-6, constant scheduler

训练 Bucket (10 个)

Bucket任务训练样本数test_final_new Δ
tibetan\\annotation注释5,273+0.03pp
traditional\mongolian\\_annotation注释2,403+1.54pp
manchu\\annotation注释5,068+0.61pp
tangut\\segmentation断句3,305+0.43pp
zhuang\\segmentation断句222-0.92pp
uyghur\\restoration修复4,335-1.81pp
classical\chinese\\_translation翻译10,000+0.35pp
zhuang\\translation翻译10,000-0.58pp
traditional\mongolian\\_translation翻译10,000+1.06pp
tangut\\translation翻译10,000-0.98pp

总训练数据: 60,606 samples (每 bucket ≤ 10,000,均衡采样)

评测结果 (sacrebleu sentence-BLEU-2, 0-100)

在 testfinalnew 上评测 (50 samples/bucket, n=8, temp=0.7):

BucketBaselineThis ModelΔ
traditional\_mongolian / annotation57.0458.58+1.54pp
traditional\_mongolian / translation29.4230.48+1.06pp
manchu / annotation65.4466.05+0.61pp
tangut / translation42.0941.11-0.98pp
tangut / segmentation81.7482.17+0.43pp
classical\_chinese / translation42.0442.39+0.35pp
tibetan / annotation57.7357.25-0.48pp
zhuang / translation51.2350.65-0.58pp
zhuang / segmentation66.6765.75-0.92pp
uyghur / restoration87.5885.77-1.81pp

使用方式

python
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained("MooreMuaMu/ancient-rl-grpo-pilot3-step50", torch_dtype="bfloat16", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("MooreMuaMu/ancient-rl-grpo-pilot3-step50")

关键发现

  • β=0.01 让翻译任务获得了涨点(β=0.02 时翻译无改善)
  • Step 50 是多数 bucket 的最优 checkpoint,说明早期学习最有效
  • 数据均衡(每 bucket ≤ 10k)防止了大 bucket 主导训练