CoolFace
Datasetpublic

NNEngine/Gutenberg-Clean

šŸ“š TinyWay-Gutenberg-Clean (Compressed Shards) A large-scale, high-quality English text dataset derived from Project Gutenberg. The corpus has been cleaned, normalized, deduplicated, segmented into fixed-length samples, and stored as compressed JSONL shards for efficient large-scale language model training. This dataset is intended for pretraining and experimentation with small and medium language models such as TinyWay, tokenizer training, and large-scale NLP research.… See the full description on the dataset page: https://huggingface.co/datasets/NNEngine/Gutenberg-Clean.

sourceHugging Facemitupdated 8mo agoView on Hugging Face
0likes54downloads
filetrain-00000.jsonl.gz400.0 MBdownload
filetrain-00001.jsonl.gz400.0 MBdownload
filetrain-00002.jsonl.gz400.0 MBdownload
filetrain-00003.jsonl.gz400.0 MBdownload
filetrain-00004.jsonl.gz400.0 MBdownload
filetrain-00005.jsonl.gz400.0 MBdownload
filetrain-00006.jsonl.gz400.0 MBdownload
filetrain-00007.jsonl.gz400.0 MBdownload
filetrain-00008.jsonl.gz400.0 MBdownload
filetrain-00009.jsonl.gz400.0 MBdownload
filetrain-00010.jsonl.gz400.0 MBdownload
filetrain-00011.jsonl.gz400.0 MBdownload
filetrain-00012.jsonl.gz400.0 MBdownload
filetrain-00013.jsonl.gz400.0 MBdownload
filetrain-00014.jsonl.gz400.0 MBdownload
filetrain-00015.jsonl.gz400.0 MBdownload
filetrain-00016.jsonl.gz400.0 MBdownload
filetrain-00017.jsonl.gz400.0 MBdownload
filetrain-00018.jsonl.gz400.0 MBdownload

NNEngine/Gutenberg-Clean Ā· main Ā· files are served by the source, never re-hosted here