CoolFace
Datasetpublic

melaniaghirda/fineweb-edu-subset

Small slice of the original HuggingFaceFW/fineweb-edu, data/CC-MAIN-2025-26. Files: first 10 .parquet files, split=train, columns="text", applied filters: "language_score">=0.9. Pipeline: Dataset will be further tokenized and used to train a 124M GPT model.

sourceHugging Faceupdated 7mo agoView on Hugging Face
0likes563downloads
7 commits on main
f4f3ad37mo ago

Update README.md

melaniaghirda
aaec8a57mo ago

Upload dataset

melaniaghirda
e6011907mo ago

Delete data

melaniaghirda
7a7826b7mo ago

Create data/

melaniaghirda
36fe4f27mo ago

Create README.md

melaniaghirda
4bbb2127mo ago

Create README.md

melaniaghirda
80329007mo ago

initial commit

melaniaghirda