CoolFace
Datasetpublic

guo925658/linear-ttt-dclm-100m-600m

Qwen-LaCT:完整 Stage 1 100M + Stage 2 600M 训练数据 本目录包含实际冻结数据池的完整 token 数据,可复现训练输入。100M / 600M 是阶段预算的简称。 文件 完整输入 tokens 字节数 stage1-100m-99975168tokens.int32.bin 99,975,168 399,900,672 stage2-600m-599916544tokens.int32.bin 599,916,544 2,399,666,176 数据来源:mlfoundations/dclm-baseline-1.0,revision a3b142c183aebe5af344955ae20836eb34dcf69b。 格式:小端有符号 int32,tokenizer 为原生 Qwen2.5-3B-Instruct。文件是原始 master 的精确字节切片。 使用 将目录中的全部文件下载到同一目录。 执行 sha256sum -c… See the full description on the dataset page: https://huggingface.co/datasets/guo925658/linear-ttt-dclm-100m-600m.

sourceHugging Faceupdated 11d agoView on Hugging Face
0likes53downloads
Dataset Card

Qwen-LaCT:完整 Stage 1 100M + Stage 2 600M 训练数据

本目录包含实际冻结数据池的完整 token 数据,可复现训练输入。100M / 600M 是阶段预算的简称。

文件完整输入 tokens字节数
stage1-100m-99975168tokens.int32.bin99,975,168399,900,672
stage2-600m-599916544tokens.int32.bin599,916,5442,399,666,176

数据来源:mlfoundations/dclm-baseline-1.0,revision a3b142c183aebe5af344955ae20836eb34dcf69b。 格式:小端有符号 int32,tokenizer 为原生 Qwen2.5-3B-Instruct。文件是原始 master 的精确字节切片。

使用

  1. 1.将目录中的全部文件下载到同一目录。
  2. 2.执行 sha256sum -c SHA256SUMS 验证所有上传文件。
  3. 3.执行 unzip reproducibility.zip,获得 tokenizer、采样示例、辅助数据和原始来源记录。
  4. 4.安装 numpy、torch 后执行 python reproducibility/usage.py stage1 0 或 python reproducibility/usage.py stage2 0,构造第一批真实训练输入。末尾数字是从 0 开始的 update index。

直接读取:numpy.memmap("stage1-100m-99975168tokens.int32.bin", dtype="<i4", mode="r")。 切分后的各阶段文件起点为 0;原始 master 的 offset 记录在 dataset_manifest.json。

Stage 1:序列长 12,288,每更新 4 条,共 2,034 更新;序列块打乱种子 1,000,045。 Stage 2:序列长 32,768,每更新 4 条,共 4,577 更新;序列块打乱种子 2,000,045。 这两个阶段分别对自身完整序列池执行 torch.randperm,无放回遍历一次;各序列内部 token 顺序固定。

其他文件

  • —dataset_manifest.json:每段的精确 token 数、原始区间、SHA-256、MD5 及运行时采样参数。
  • —reproducibility.zip:tokenizer、训练输入示例、数据准备代码、实际冻结 trainer、来源/视图清单、中文采样说明,以及 selection/heldout/reserve 的完整辅助 token 数据。
  • —SHA256SUMS / MD5SUMS:顶层上传文件的校验值。

重建原始 702,185,472-token master,可按以下顺序拼接二进制: selection → heldout → stage1 → stage2 → reserve。 三个辅助文件在解压后的 reproducibility/auxiliary/ 中。 重建后的 SHA-256 应为 60058bd1c16fe8549873ca4306ad21c37cc4b95ef598e8d8cd8d8c8ead4b4138。

原文档之间没有额外 EOS;packed 序列可能跨文档。源 shard 顺序按 seed 42 打乱,每个文件顺序取最多 8,388,608 tokens,Stage 1 / Stage 2 分别来自 12 / 72 个独立源 shard。 源码/原始 provenance 中的 Palmetto 绝对路径保留用于追溯;可移植读取请使用本目录 dataset_manifest.json 和 usage.py。

导出时已计算原始 master 全文件 SHA-256,逐段写入后重新读取验证每段 SHA-256 与字节数。