youngseok12/AX-3.1-Light-specialist-r1-ta_avg
0322
A.X-3.1-Light — Specialist LoRA Merge (ta_avg)
세 개의 축별 specialist LoRA(K/R/C)를 각각 따로 학습한 뒤 Task Arithmetic (linear)로 병합한 BF16 전체 가중치 모델입니다. 별도 adapter가 필요하지 않습니다.
연구·평가용 모델입니다. 생성 결과가 부정확할 수 있으므로 의료·법률·재정 등 고위험 의사결정의 유일한 근거로 사용해서는 안 됩니다.
Model information
- Base model: `skt/A.X-3.1-Light`
- Base revision:
9b41bb2406472634d8812c0b8931fa40fa9a6c3a - Merge method: Task Arithmetic (linear) — K + R + C, weights 1/3 each
- Format: standalone BF16
safetensors - Chat template: base 원본 그대로 (수정하지 않음)
Specialist LoRAs
각 LoRA는 담당 축의 데이터만 3,000행 학습했고, 학습 조건은 세 개가 완전히 동일합니다 (유일한 변수는 데이터). 전 축 4지선다 ①②③④ + answer-first 한 줄 타깃 스키마.
- Train loss: K 0.1302 / R 0.1187 / C 0.0334
- Held-out format probe (240 canonical public-benchmark items, greedy): answer stated in 100.0% of outputs, mean 13 output tokens
전처리
- 5지선다 → 4지선다 변환 (공식 벤치마크가 4지선다)
- 정답 위치 균등화 — 세 LoRA 모두 ①②③④ 각 750개
- 71568:
calculation수식이 있는 정답만 사용, 오답을 수식 변형으로 생성(검증 가능) - 71949: 원본이 이미지 기반 MCQ이므로 텍스트 인과 CoT를 시드로 4지선다 합성, 이미지를 지칭하는 항목은 전량 제외
Training configuration (three LoRAs identical)
Notes
- 공개 벤치마크 test set을 직접 학습하지 않았습니다.
- 병합은 단일 GPU에서 수행했고, 전 파라미터 NaN/Inf 검사를 통과했습니다.
