NNEngine/Gutenberg-Clean
š TinyWay-Gutenberg-Clean (Compressed Shards) A large-scale, high-quality English text dataset derived from Project Gutenberg. The corpus has been cleaned, normalized, deduplicated, segmented into fixed-length samples, and stored as compressed JSONL shards for efficient large-scale language model training. This dataset is intended for pretraining and experimentation with small and medium language models such as TinyWay, tokenizer training, and large-scale NLP research.⦠See the full description on the dataset page: https://huggingface.co/datasets/NNEngine/Gutenberg-Clean.
054
train-00000.jsonl.gzdownload
train-00001.jsonl.gzdownload
train-00002.jsonl.gzdownload
train-00003.jsonl.gzdownload
train-00004.jsonl.gzdownload
train-00005.jsonl.gzdownload
train-00006.jsonl.gzdownload
train-00007.jsonl.gzdownload
train-00008.jsonl.gzdownload
train-00009.jsonl.gzdownload
train-00010.jsonl.gzdownload
train-00011.jsonl.gzdownload
train-00012.jsonl.gzdownload
train-00013.jsonl.gzdownload
train-00014.jsonl.gzdownload
train-00015.jsonl.gzdownload
train-00016.jsonl.gzdownload
train-00017.jsonl.gzdownload
train-00018.jsonl.gzdownload
