SeanWang0027/rose-tinker-step1-rollouts
rose-tinker-step1-rollouts Online ROSE 一个训练步的完整 rollout 样本(数据侧探查, 未训练)。 学生: Qwen3-1.7B(基线权重 = 真训练 step 1 时的学生), temperature 1.0 / top_p 1.0 teacher: nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16, 经 Tinker API, temperature 1.0 / top_p 1.0 形状: 128 题 x n=2 = 256 条; 学生前缀 4096 tok, teacher 续写 1024 tok 数据: RLVE 训练集前 128 题 每行字段: question 原题 student_prefix 学生写的前缀全文(在第 4096 token 处切断) teacher_text Nemotron 从切口续写的全文(1024 nemo-token 预算) ce_target_tokens 重编码到学生词表后真正进 CE 的 token 数… See the full description on the dataset page: https://huggingface.co/datasets/SeanWang0027/rose-tinker-step1-rollouts.
rose-tinker-step1-rollouts
Online ROSE 一个训练步的完整 rollout 样本(数据侧探查, 未训练)。
- 学生: Qwen3-1.7B(基线权重 = 真训练 step 1 时的学生), temperature 1.0 / top_p 1.0
- teacher: nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16, 经 Tinker API, temperature 1.0 / top_p 1.0
- 形状: 128 题 x n=2 = 256 条; 学生前缀 4096 tok, teacher 续写 1024 tok
- 数据: RLVE 训练集前 128 题
每行字段:
question原题student_prefix学生写的前缀全文(在第 4096 token 处切断)teacher_textNemotron 从切口续写的全文(1024 nemo-token 预算)ce_target_tokens重编码到学生词表后真正进 CE 的 token 数seam_shift重编码后 mask 边界移动的学生 token 数(0 = 无损)
跨词表流程: 学生前缀 decode 成文本 -> 包进 Nemotron 自己的 chat template -> Nemotron 分词器 encode 后经 Tinker 采样 -> 输出 decode 成文本 -> 学生分词器 对 prefix+teacher 重新 encode, 最长公共前缀定 mask 边界。
