sagels/longmino_256k_filtered
longmino_filtered 本目录为 Dolma 3 Longmino Pool 数据经简单过滤后的分片,按子集分子文件夹存放。数据无需转换为 Parquet 即可配合 Hugging Face datasets 使用(见 scripts/load_longmino_example.py)。 数据来源与处理 上游数据集:allenai/dolma3_longmino_pool(Dolma 3 Longmino Pool,非混合后的训练 mix;详见该数据集说明)。 本目录:仅对上游数据做了简单过滤得到的副本文档集合,不是 Ai2 官方发行物,也不代表上游数据的完整或最新版本。 用途说明:以自用(个人研究/训练)为主,无面向公众的推广义务;若他人获取副本,仍应遵守下方许可与上游要求。 许可 遵循上游 Open Data Commons Attribution License v1.0(ODC-By) 及 dolma3_longmino_pool… See the full description on the dataset page: https://huggingface.co/datasets/sagels/longmino_256k_filtered.
longmino_filtered
本目录为 Dolma 3 Longmino Pool 数据经简单过滤后的分片,按子集分子文件夹存放。数据无需转换为 Parquet 即可配合 Hugging Face datasets 使用(见 scripts/load_longmino_example.py)。
数据来源与处理
- 上游数据集:allenai/dolma3_longmino_pool(Dolma 3 Longmino Pool,非混合后的训练 mix;详见该数据集说明)。
- 本目录:仅对上游数据做了简单过滤得到的副本文档集合,不是 Ai2 官方发行物,也不代表上游数据的完整或最新版本。
- 用途说明:以自用(个人研究/训练)为主,无面向公众的推广义务;若他人获取副本,仍应遵守下方许可与上游要求。
许可
遵循上游 Open Data Commons Attribution License v1.0(ODC-By) 及 dolma3_longmino_pool 页面中的许可与使用说明;引用与责任边界请以 Ai2 / 官方数据集页面 为准。详细条款见上游 Dataset Card 中的 Licensing Information。
目录结构
每个子目录下为多个 gzip 压缩的 JSONL 文件:longmino_<子集名>-NNNN.jsonl.gz。
注意:少数分片文件扩展名为 .json.gz,内容为多行 JSON(与 JSONL 相同读法),不是「单个 JSON 数组」;加载时需与 .jsonl.gz 一并纳入 data_files(示例脚本已处理)。
单条样本 schema(顶层)
每条 JSON 为一行,主要字段:
text(string):正文。id(string):文档标识。source、added、created:string。metadata(object):嵌套元数据,常见键包括Source-Url、length、provenance、len_cl100k_base等;不同子集可能包含额外键(如synth_cwe)。
完整字段以实际数据为准;若在不同 shard 间类型不一致,可在 load_dataset 时传入 features= 或先将 metadata 序列化为字符串再训练。
依赖
pip install datasets(若仅做分片校验,也可只用标准库读 gzip 首行。)
示例
# 列出某子集分片并查看第一个分片首条样本的顶层字段与 text 前缀
python scripts/load_longmino_example.py --root . --subset synth_cwe --peek
# 流式读取前几项(省内存)
python scripts/load_longmino_example.py --root . --subset 2e15 --streaming --max-items 3将 --root 换成本目录的绝对路径亦可。
与 Hugging Face Hub
若将本目录同步到个人 Hub 仓库(例如 longmino_256k_filtered),请在 Dataset Card 中保留对上述上游链接与 ODC-By 的说明;本 README 可作为草稿。若仅在本机或共享盘使用,可以不建 Hub 数据集仓库。
