CoolFace
Datasetpublic

SeanWang0027/rose-tinker-step1-rollouts

rose-tinker-step1-rollouts Online ROSE 一个训练步的完整 rollout 样本(数据侧探查, 未训练)。 学生: Qwen3-1.7B(基线权重 = 真训练 step 1 时的学生), temperature 1.0 / top_p 1.0 teacher: nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16, 经 Tinker API, temperature 1.0 / top_p 1.0 形状: 128 题 x n=2 = 256 条; 学生前缀 4096 tok, teacher 续写 1024 tok 数据: RLVE 训练集前 128 题 每行字段: question 原题 student_prefix 学生写的前缀全文(在第 4096 token 处切断) teacher_text Nemotron 从切口续写的全文(1024 nemo-token 预算) ce_target_tokens 重编码到学生词表后真正进 CE 的 token 数… See the full description on the dataset page: https://huggingface.co/datasets/SeanWang0027/rose-tinker-step1-rollouts.

sourceHugging Faceupdated 1mo agoView on Hugging Face
0likes14downloads
Dataset Card

rose-tinker-step1-rollouts

Online ROSE 一个训练步的完整 rollout 样本(数据侧探查, 未训练)。

  • 学生: Qwen3-1.7B(基线权重 = 真训练 step 1 时的学生), temperature 1.0 / top_p 1.0
  • teacher: nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16, 经 Tinker API, temperature 1.0 / top_p 1.0
  • 形状: 128 题 x n=2 = 256 条; 学生前缀 4096 tok, teacher 续写 1024 tok
  • 数据: RLVE 训练集前 128 题

每行字段:

  • question 原题
  • student_prefix 学生写的前缀全文(在第 4096 token 处切断)
  • teacher_text Nemotron 从切口续写的全文(1024 nemo-token 预算)
  • ce_target_tokens 重编码到学生词表后真正进 CE 的 token 数
  • seam_shift 重编码后 mask 边界移动的学生 token 数(0 = 无损)

跨词表流程: 学生前缀 decode 成文本 -> 包进 Nemotron 自己的 chat template -> Nemotron 分词器 encode 后经 Tinker 采样 -> 输出 decode 成文本 -> 学生分词器 对 prefix+teacher 重新 encode, 最长公共前缀定 mask 边界。