guo925658/linear-ttt-dclm-100m-600m
Qwen-LaCT:完整 Stage 1 100M + Stage 2 600M 训练数据 本目录包含实际冻结数据池的完整 token 数据,可复现训练输入。100M / 600M 是阶段预算的简称。 文件 完整输入 tokens 字节数 stage1-100m-99975168tokens.int32.bin 99,975,168 399,900,672 stage2-600m-599916544tokens.int32.bin 599,916,544 2,399,666,176 数据来源:mlfoundations/dclm-baseline-1.0,revision a3b142c183aebe5af344955ae20836eb34dcf69b。 格式:小端有符号 int32,tokenizer 为原生 Qwen2.5-3B-Instruct。文件是原始 master 的精确字节切片。 使用 将目录中的全部文件下载到同一目录。 执行 sha256sum -c… See the full description on the dataset page: https://huggingface.co/datasets/guo925658/linear-ttt-dclm-100m-600m.
Qwen-LaCT:完整 Stage 1 100M + Stage 2 600M 训练数据
本目录包含实际冻结数据池的完整 token 数据,可复现训练输入。100M / 600M 是阶段预算的简称。
数据来源:mlfoundations/dclm-baseline-1.0,revision a3b142c183aebe5af344955ae20836eb34dcf69b。 格式:小端有符号 int32,tokenizer 为原生 Qwen2.5-3B-Instruct。文件是原始 master 的精确字节切片。
使用
- 将目录中的全部文件下载到同一目录。
- 执行
sha256sum -c SHA256SUMS验证所有上传文件。 - 执行
unzip reproducibility.zip,获得 tokenizer、采样示例、辅助数据和原始来源记录。 - 安装 numpy、torch 后执行
python reproducibility/usage.py stage1 0或python reproducibility/usage.py stage2 0,构造第一批真实训练输入。末尾数字是从 0 开始的 update index。
直接读取:numpy.memmap("stage1-100m-99975168tokens.int32.bin", dtype="<i4", mode="r")。 切分后的各阶段文件起点为 0;原始 master 的 offset 记录在 dataset_manifest.json。
Stage 1:序列长 12,288,每更新 4 条,共 2,034 更新;序列块打乱种子 1,000,045。 Stage 2:序列长 32,768,每更新 4 条,共 4,577 更新;序列块打乱种子 2,000,045。 这两个阶段分别对自身完整序列池执行 torch.randperm,无放回遍历一次;各序列内部 token 顺序固定。
其他文件
dataset_manifest.json:每段的精确 token 数、原始区间、SHA-256、MD5 及运行时采样参数。reproducibility.zip:tokenizer、训练输入示例、数据准备代码、实际冻结 trainer、来源/视图清单、中文采样说明,以及 selection/heldout/reserve 的完整辅助 token 数据。SHA256SUMS/MD5SUMS:顶层上传文件的校验值。
重建原始 702,185,472-token master,可按以下顺序拼接二进制: selection → heldout → stage1 → stage2 → reserve。 三个辅助文件在解压后的 reproducibility/auxiliary/ 中。 重建后的 SHA-256 应为 60058bd1c16fe8549873ca4306ad21c37cc4b95ef598e8d8cd8d8c8ead4b4138。
原文档之间没有额外 EOS;packed 序列可能跨文档。源 shard 顺序按 seed 42 打乱,每个文件顺序取最多 8,388,608 tokens,Stage 1 / Stage 2 分别来自 12 / 72 个独立源 shard。 源码/原始 provenance 中的 Palmetto 绝对路径保留用于追溯;可移植读取请使用本目录 dataset_manifest.json 和 usage.py。
导出时已计算原始 master 全文件 SHA-256,逐段写入后重新读取验证每段 SHA-256 与字节数。
