melaniaghirda/fineweb-edu-subset
Small slice of the original HuggingFaceFW/fineweb-edu, data/CC-MAIN-2025-26. Files: first 10 .parquet files, split=train, columns="text", applied filters: "language_score">=0.9. Pipeline: Dataset will be further tokenized and used to train a 124M GPT model.
0563
Update README.md
Upload dataset
Delete data
Create data/
Create README.md
Create README.md
initial commit
