melaniaghirda/fineweb-edu-subset
Small slice of the original HuggingFaceFW/fineweb-edu, data/CC-MAIN-2025-26. Files: first 10 .parquet files, split=train, columns="text", applied filters: "language_score">=0.9. Pipeline: Dataset will be further tokenized and used to train a 124M GPT model.
0519
Small slice of the original HuggingFaceFW/fineweb-edu, data/CC-MAIN-2025-26.<br> Files: first 10 .parquet files, split=train, columns="text", applied filters: "language_score">=0.9.<br> Pipeline: Dataset will be further tokenized and used to train a 124M GPT model.
