traffic-legal-lm/round2-sonnet46-lora
06
Round 2 LoRA — Sonnet 4.6 資料集
第二輪 LoRA 微調,使用本團隊 Step1-4 流程(規則式篩選 + 結構化抽取 + Claude Sonnet 4.6 白話化改寫)產出的 traffic_legal_0603_train/val 資料集,對 yentinglin/Llama-3-Taiwan-8B-Instruct-rc2 進行微調。輸出格式為簡潔三行(責任類型 / 適用法條 / 核心爭議,核心爭議為 12 類封閉標籤)。
訓練設定
- Base model:
yentinglin/Llama-3-Taiwan-8B-Instruct-rc2 - Dataset:
traffic_legal_0603_train/traffic_legal_0603_val - Method: LoRA,
lora_target=all, rank=16, alpha=32, dropout=0.05 - Batch size: perdevice=2, gradaccum=4(有效 batch=16)
- Epochs: 2, lr=2e-4 (cosine, warmup 10%), bf16, gradient checkpointing
- Early stopping: 依 evalloss(evalsteps=100)
訓練結果
- trainloss: 0.210, evalloss: 0.155
評估結果(18 筆共享 test set,與 round2-gpt4o-baseline-lora 對照)
詳細逐案分析見 repo 內 report.md 第八章與 eval/eval_summary.json。
使用方式
from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel
base_model_id = "yentinglin/Llama-3-Taiwan-8B-Instruct-rc2"
adapter_id = "traffic-legal-lm/round2-sonnet46-lora"
tokenizer = AutoTokenizer.from_pretrained(base_model_id)
model = AutoModelForCausalLM.from_pretrained(base_model_id, torch_dtype="bfloat16", device_map="auto")
model = PeftModel.from_pretrained(model, adapter_id)更完整的處理流程、資料集與評估說明請見專案 repo: Traffic_Legal_LM
