richarddzh/chinese-small-lm-corpus
Chinese Small LM Corpus 用于中文小型语言模型预训练的统一文本语料,字段为: text:规范化后的训练文本 source:原始数据集名称 数据量 来源 有效样本数 TinyStories-Zh-2M 1,994,291 Wikipedia-20231101.zh 1,384,748 Zhihu-KOL 1,002,863 总计 4,381,902 来源与许可 RobinChen2001/TinyStories-Zh-2M:数据卡标注 MIT;同时应检查英文上游数据及机器翻译来源条款。 wikimedia/wikipedia (20231101.zh):CC BY-SA 3.0 与 GFDL。 wangrui6/Zhihu-KOL:原数据卡未声明许可证。 此合并数据集不提供统一的再授权。下载者须分别遵守各来源的许可、署名、隐私与内容使用要求。
Add dataset card
Upload data/train-00087.parquet
Upload data/train-00086.parquet
Upload data/train-00085.parquet
Upload data/train-00084.parquet
Upload data/train-00083.parquet
Upload data/train-00082.parquet
Upload data/train-00081.parquet
Upload data/train-00080.parquet
Upload data/train-00079.parquet
Upload data/train-00078.parquet
Upload data/train-00077.parquet
Upload data/train-00076.parquet
Upload data/train-00075.parquet
Upload data/train-00074.parquet
Upload data/train-00073.parquet
Upload data/train-00072.parquet
Upload data/train-00071.parquet
Upload data/train-00070.parquet
Upload data/train-00069.parquet
Upload data/train-00068.parquet
Upload data/train-00067.parquet
Upload data/train-00066.parquet
Upload data/train-00065.parquet
Upload data/train-00064.parquet
Upload data/train-00063.parquet
Upload data/train-00062.parquet
Upload data/train-00061.parquet
Upload data/train-00060.parquet
Upload data/train-00059.parquet
Upload data/train-00058.parquet
Upload data/train-00057.parquet
Upload data/train-00056.parquet
Upload data/train-00055.parquet
Upload data/train-00054.parquet
Upload data/train-00053.parquet
Upload data/train-00052.parquet
Upload data/train-00051.parquet
Upload data/train-00050.parquet
Upload data/train-00049.parquet
Upload data/train-00048.parquet
Upload data/train-00047.parquet
Upload data/train-00046.parquet
Upload data/train-00045.parquet
Upload data/train-00044.parquet
Upload data/train-00043.parquet
Upload data/train-00042.parquet
Upload data/train-00041.parquet
Upload data/train-00040.parquet
Upload data/train-00039.parquet
