Lelonthecodeur/every-language-dataset-v3
Every Language Dataset V3 Next-generation synthetic multilingual dataset. Size Total: 25,000,000 Train: 24,000,000 Validation: 500,000 Test: 500,000 Diversity Human-language catalog: 171 language codes. Programming languages: 50. Task families: conversation question answering reasoning logic arithmetic translation summarization explanation code generation code explanation debugging Format Parquet + ZSTD. Generation… See the full description on the dataset page: https://huggingface.co/datasets/Lelonthecodeur/every-language-dataset-v3.
Every Language Dataset V3
Next-generation synthetic multilingual dataset.
Size
Total: 25,000,000
- Train: 24,000,000
- Validation: 500,000
- Test: 500,000
Diversity
Human-language catalog: 171 language codes.
Programming languages: 50.
Task families:
- conversation
- question answering
- reasoning
- logic
- arithmetic
- translation
- summarization
- explanation
- code generation
- code explanation
- debugging
Format
Parquet + ZSTD.
Generation
Deterministic per-example seeds and split-specific fingerprints are used to reduce exact duplication and keep the splits separated.
Version: 3.1.0-nextgen
