CoolFace
Modelpublic

Aurorra1123/tmax-9b-sft-deepseek-4264

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes10downloads
Model Card

tmax-9b-sft-deepseek-4264

在 Qwen3.5-9B 上用 DeepSeek 教师成功轨迹做 SFT 的 checkpoint。属于一组成对对照实验中的一条,用于比较训练数据来源(DeepSeek 教师 / Qwen3.5-9B 自采)对终端任务能力的影响。

训练数据

  • —来源:Aurorra1123/tmax-selfdistill-datasets 中 DeepSeek k=4 采集、reward==1 的成功轨迹。
  • —条数:4264(从 6163 条成功轨迹中按固定种子 42 随机抽取,与自采对照腿条数一致)。
  • —内容:TB Lite 终端任务多轮交互轨迹,含 thinking(CoT)字段。

训练设置

项值
基座Qwen3.5-9B
学习率2e-5
调度器linear,warmup 0.03
weight_decay0.0
epoch1
全局 batch size128
maxseqlength16384
优化步数34
精度bf16,DeepSpeed ZeRO-3(无 offload)
硬件4×H200
框架open-instruct(finetune.py)

对照腿

同组自采对照:Aurorra1123/tmax-9b-sft-self-4264(同样 4264 条、34 步,数据来源为 Qwen3.5-9B 自采成功轨迹)。两腿唯一变量为训练数据来源。

加载说明

open-instruct 保存的是纯文本 CausalLM 权重。Qwen3.5-9B 为多模态结构,若需用 vLLM 部署,需要先构建多模态 wrapper(复用基座的多模态 config/tokenizer 与 vision 权重,软链本 checkpoint 的文本权重)后再加载。