Aurorra1123/tmax-9b-sft-deepseek-4264
010
tmax-9b-sft-deepseek-4264
在 Qwen3.5-9B 上用 DeepSeek 教师成功轨迹做 SFT 的 checkpoint。属于一组成对对照实验中的一条,用于比较训练数据来源(DeepSeek 教师 / Qwen3.5-9B 自采)对终端任务能力的影响。
训练数据
- 来源:
Aurorra1123/tmax-selfdistill-datasets中 DeepSeek k=4 采集、reward==1 的成功轨迹。 - 条数:4264(从 6163 条成功轨迹中按固定种子 42 随机抽取,与自采对照腿条数一致)。
- 内容:TB Lite 终端任务多轮交互轨迹,含 thinking(CoT)字段。
训练设置
对照腿
同组自采对照:Aurorra1123/tmax-9b-sft-self-4264(同样 4264 条、34 步,数据来源为 Qwen3.5-9B 自采成功轨迹)。两腿唯一变量为训练数据来源。
加载说明
open-instruct 保存的是纯文本 CausalLM 权重。Qwen3.5-9B 为多模态结构,若需用 vLLM 部署,需要先构建多模态 wrapper(复用基座的多模态 config/tokenizer 与 vision 权重,软链本 checkpoint 的文本权重)后再加载。
