Yuivdldk/math-model-vertex-arm-l45-g4b-lora
頂點臂(difficulty-vertex arm)— Gemma-3-4B LoRA
科展研究「相對難度決定微調收益」的第三支外部老師臂。 這是倒 U 律的事前檢驗,不是一個要拿來用的模型 —— 它比基線差。
這個臂要回答什麼
先前用乾淨的難度軸(maxnew 4096、n=2538)量到:微調造成的相對損失 在 pass@8 中段最重,*頂點 k\ = 4.15–4.58**。
兩個既有的外部老師臂都避開了頂點,而且離頂點近的那個傷得更重:
倒 U 律事後解釋了這個排序。本臂把訓練題壓在頂點上(平均 k=3.96), 檢驗它有沒有事前預測力。
🔴 事前預測登記在生成之前(commit e792e57,2026-07-29T01:46:35Z):
主要預測:Δfallback < −5.83pp(比控制臂更重)
沒中的定義:(a) Δfallback ≥ −5.83pp,或
(b) 差值(頂點臂 − 控制臂)的 95% CI 上界觸及 0
⇒ 只能宣稱「未能區分」,不得宣稱倒 U 律被驗證訓練資料
劑量、seed、replay 池、長度上限與控制臂逐筆相同。 唯一變動的是訓練題落在難度軸的哪裡。
訓練集由 build_dose_control_sft.py --arm vertex_arm 產出。同一支 builder 用控制臂的原始輸入重建,能逐位還原已落地的 d99f688c… —— 這道回歸閘門 在建本臂訓練集之前先跑過,確認配方沒被改動。
配方
lr 1e-4 · epochs 1.0 · max-length 4096 · per-device 1 × grad-accum 8 · seed 42
LoRA r=16 alpha=32 dropout=0.05 · 238 個目標 module(僅 language_model)
train_loss 0.2676 · train_runtime 145s
base google/gemma-3-4b-it @ 093f9f388b31de276ce2de164bdc2081324b9767逐字複製 targeted v2 / 控制臂的配方。training_provenance_v2.json 裡的 kind 寫 targeted_sft_v2_training,那是訓練器的固定標籤, 代表「用的是 targeted v2 那套配方」,不是說這是 targeted v2 的資料。
合併已驗證:238/238 個目標張量改變,重載後仍不同,eos_token_id=[1, 106]。
評測
n=2538(MATH test L4–5)、max_new 4096、VLLM_BATCH_INVARIANT=1、 temp 0、seed 0,scorer direct-axis-balanced-box-v2.1-timeout-safe+math-verify-0.9.0。 與 targeted v2 / 控制臂同一把尺(跨尺相減在本研究是禁止的)。
結果
🔴 事前判準的裁決:【未能區分】
主要終點 頂點臂 − 控制臂 = -0.16pp
W/L 190/194 discordant 384
95% CI [-1.65, +1.38]pp exact McNemar p = 0.8784
MDE(80%) = 2.16pp
(a) Δ < 0(比控制臂更重) ✅ 是
(b) 95% CI 上界 < 0(不觸及 0) ❌ 否依登記檔:不得宣稱倒 U 律被驗證。只能寫成 「差異方向與預測一致,但本樣本量無法排除無差異」。
單峰也未成立。 離頂點最近的頂點臂必須顯著重於另外兩臂才算數: vs targeted v2 −1.54pp(CI [−3.12, +0.04],p=.063)、 vs 控制臂 −0.16pp(p=.878)—— 兩個都不顯著。
這個臂真正買到的是什麼
三支外部老師臂的訓練題難度從 k=0.00 掃到 5.93(涵蓋頂點), Δ vs 基線全部落在 −4.45 ~ −5.99pp 的窄帶內。
⇒ 可辯護的宣稱:在本配方下,訓練題的難度位置對傷害量級的影響上界約 1.5pp, 遠小於「有沒有做這種 SFT」的 4–6pp。
倒 U 律描述的是單一臂內部、逐題的損失分布;本臂顯示那個形狀 不能外推成「選對難度就能少傷」。這兩件事以前被混在一起講。
已知限制
- 評測跨了機器重啟。先前量到的跨機器漂移 −0.61pp 大於本臂的主要終點 −0.16pp, 因此該終點不可作方向性解讀(這只會讓「未能區分」更成立,不會反轉它)。
- 共變量:老師解長度、題型組成、訓練日期。
- 候選只有 339 題,抽 265 後自由度低。
判準分級
依本研究的三級判準,外部老師臂是負結果:SFT 於外部老師解會造成 災難性遺忘,且損失與訓練題的相對難度有關。本 adapter 公開的目的是 可重現性,不是拿來部署。
相關
Yuivdldk/math-model-targeted-v2-l45-g4b-lora— targeted v2(k=0.00)Yuivdldk/math-model-dose-control-l45-g4b-lora— 控制臂(k=5.93)Yuivdldk/axis-majk-selfconsistency— 乾淨難度軸與 maj@k
