adasdadsd/VibeThinker-SFT-Stage1-CoT
VibeThinker SFT Stage 1 CoT VibeThinker 第一阶段监督微调数据。仓库当前保持私有。 数据规模 train:1,842,263 条 validation:2,816 条 internal_test:2,813 条 总计:1,847,892 条 格式 主文件为 data/sft_stage1.jsonl,每行是一个独立 JSON 对象。训练内容采用 Qwen3.5 消息格式,包含 messages、稳定记录/问题标识、领域、切分、来源与验证证据。 监督回答经过 CoT 格式检查,推理过程使用 <think>...</think> 边界。 数据处理 数据经过规范化、精确去重、近似去重、基准污染过滤、CoT 校验、稳定切分与 领域质量门禁。SFT 域比例不是硬配额:通过质量门禁的数据不会因为代码数据不足 而被额外裁剪。每个来源的许可与溯源信息保留在记录的 provenance 字段中;使用者 应按原始数据源许可审查自己的使用场景。… See the full description on the dataset page: https://huggingface.co/datasets/adasdadsd/VibeThinker-SFT-Stage1-CoT.
VibeThinker SFT Stage 1 CoT
VibeThinker 第一阶段监督微调数据。仓库当前保持私有。
数据规模
- train:1,842,263 条
- validation:2,816 条
- internal_test:2,813 条
- 总计:1,847,892 条
格式
主文件为 data/sft_stage1.jsonl,每行是一个独立 JSON 对象。训练内容采用 Qwen3.5 消息格式,包含 messages、稳定记录/问题标识、领域、切分、来源与验证证据。 监督回答经过 CoT 格式检查,推理过程使用 <think>...</think> 边界。
数据处理
数据经过规范化、精确去重、近似去重、基准污染过滤、CoT 校验、稳定切分与 领域质量门禁。SFT 域比例不是硬配额:通过质量门禁的数据不会因为代码数据不足 而被额外裁剪。每个来源的许可与溯源信息保留在记录的 provenance 字段中;使用者 应按原始数据源许可审查自己的使用场景。
训练使用
训练时读取 split == "train" 的记录;验证和内部测试切分不得混入训练。应使用 仓库配套 pipeline 中冻结的 Qwen3.5 chat template,并在训练前复核文件摘要和记录数。
