CoolFace
Datasetpublic

Xirui1208/readtwice-docqa-hqa-rl-2560-20260925

ReadTwice DocQA/HQA RL 训练数据 这是本次 14B step15 后的 DocQA RL 阶段实际读取的数据,与此前 7B 初始 DocQA 阶段使用的混合数据相同。mixture.parquet 和 mixture_rows.json 与训练输入逐字节一致。 来源 条数 DocQA-RL-1.6K(train,去重后) 1,585 HotpotQA 32K(train) 975 合计 2,560 DocQA 含 624 道选择题、553 道数值题、408 道文本问答。保留原始题目、选项和完整文档;文档最长 59,473 tokens,每 chunk 最多 5,000 tokens,最多 12 chunks。长度桶的 112000 是桶标签,不是每条文档有112K tokens。 这份数据没有做离线 pass@k 筛选;原训练流程会用当前策略每题采样8次,保留答对1–7次的题组。数据构建时排除了记录在源清单中的评测题目/文档重合。没有加入本次 oracle 理想上限评测数据,也没有把答案或… See the full description on the dataset page: https://huggingface.co/datasets/Xirui1208/readtwice-docqa-hqa-rl-2560-20260925.

sourceHugging Faceupdated 2d agoView on Hugging Face
0likes35downloads
Dataset Card

ReadTwice DocQA/HQA RL 训练数据

这是本次 14B step15 后的 DocQA RL 阶段实际读取的数据,与此前 7B 初始 DocQA 阶段使用的混合数据相同。mixture.parquet 和 mixture_rows.json 与训练输入逐字节一致。

来源条数
DocQA-RL-1.6K(train,去重后)1,585
HotpotQA 32K(train)975
合计2,560

DocQA 含 624 道选择题、553 道数值题、408 道文本问答。保留原始题目、选项和完整文档;文档最长 59,473 tokens,每 chunk 最多 5,000 tokens,最多 12 chunks。长度桶的 112000 是桶标签,不是每条文档有112K tokens。

这份数据没有做离线 pass@k 筛选;原训练流程会用当前策略每题采样8次,保留答对1–7次的题组。数据构建时排除了记录在源清单中的评测题目/文档重合。没有加入本次 oracle 理想上限评测数据,也没有把答案或 teacher memory 加入提示词。它是公开训练来源构建的混合,不声称是 MemAgent 作者原始混合的精确索引复现。

换机器训练流程

先读 WORKFLOW_zh.md:下载模型和数据、字段接入、两遍读取、n=8在线筛选、更新规则、跨卡组批及保存/验收。附 verify_data.py、原始提示词和源环境版本记录。

下载

仓库为公开,无需登录即可下载。

bash
hf download Xirui1208/readtwice-docqa-hqa-rl-2560-20260925 \
  --repo-type dataset --local-dir ./docqa_hqa_rl

或:

python
from huggingface_hub import snapshot_download
snapshot_download('Xirui1208/readtwice-docqa-hqa-rl-2560-20260925',
                  repo_type='dataset', local_dir='./docqa_hqa_rl')
python
from datasets import load_dataset
train = load_dataset('parquet', data_files='./docqa_hqa_rl/mixture.parquet', split='train')
assert len(train) == 2560

字段

  • —prompt:题目和选项,单条 user message。选择题额外要求输出 A/B/C/D 中一个选项字母。
  • —context:完整原始文档。普通只读 `prompt` 的训练器会漏掉文档,必须使用 context 或 verified_chunks。
  • —verified_chunks / verified_chunk_lengths:无损分块及各块 token 数;连接 chunks 等于 context。缓存与 data_manifest.json 所列 tokenizer 对应,换 tokenizer 时须重新分块。
  • —reward_model.ground_truth:结构化标签,含 kind、answer、references。
  • —data_source:docqa / hotpotqa,用于路由奖励函数。
  • —extra_info:题目、样本 UID、索引、来源等;数值题评分需要传入其中的 question。
  • —mixture_rows.json:与 parquet 行序对应的元数据。

奖励函数

入口是 rewards/readtwice_memagent_v2_stage2_v2.py:compute_score。四个 rewards 文件要放在同一目录,仅依赖 Python 标准库。

输出要求单个 \boxed{答案}。选择题按选项字母;数值题按显式数值容差并处理题目相关的货币/百分号格式;文本/HQA 按标准化 exact match 和数据内显式 references。这里的 typed scorer 是本项目实际训练使用的版本,不声称与上游 DocQA 官方评分完全一致。

python
import importlib.util
spec = importlib.util.spec_from_file_location('reward', './docqa_hqa_rl/rewards/readtwice_memagent_v2_stage2_v2.py')
reward = importlib.util.module_from_spec(spec)
spec.loader.exec_module(reward)
row = train[0]
score = reward.compute_score(row['data_source'], prediction,
                             row['reward_model']['ground_truth'], row['extra_info'])

续训权重与参数

可下载的起点是 14B RL step15。该 HF 仓库提供模型权重,没有原机器的分布式优化器状态。在新机器加载它即可从相同模型参数继续;重新创建优化器与完整断点恢复有区别。

training_recipe.json 记录本次采样和训练超参数,供迁移时对照;它不是直接可运行的 trainer 配置。该包包含实际数据、奖励函数和说明,不包含尚未完成验证的本地训练器修复。

来源与验证

准确 revision、来源文件哈希和预处理信息见 data_manifest.json。使用须遵循各来源的数据条款;本包不重新授予来源数据的许可。

本地导出验证了全部 2,560 行的文档无损拼接、行序、UID、文档哈希,以及随包奖励函数对每行标准答案返回1。全部文件哈希见 checksums.json。