CoolFace
Datasetpublic

erenyeager-1/tiny-aya-l2-thinker-multilingual-reasoning

Tiny Aya L2 Multilingual Reasoning (44 languages) Translated multilingual reasoning traces used to train Tiny Aya L2-Thinker. Each example has the prompt, thinking, and answer in the same non-English language alongside the original texts in English. Languages (44) Language Train Test Total Amharic (am) 3,807 448 4,255 Arabic (ar) 22,968 2,538 25,506 Bulgarian (bg) 4,177 452 4,629 Bengali (bn) 3,803 422 4,225 Catalan (ca) 4,251 512 4,763 Czech… See the full description on the dataset page: https://huggingface.co/datasets/erenyeager-1/tiny-aya-l2-thinker-multilingual-reasoning.

sourceHugging Facecc-by-nc-4.0updated 14d agoView on Hugging Face
0likes286downloads
Dataset Card

Tiny Aya L2 Multilingual Reasoning (44 languages)

Translated multilingual reasoning traces used to train **Tiny Aya L2-Thinker**. Each example has the prompt, thinking, and answer in the same non-English language alongside the original texts in English.

Languages (44)

LanguageTrainTestTotal
Amharic (am)3,8074484,255
Arabic (ar)22,9682,53825,506
Bulgarian (bg)4,1774524,629
Bengali (bn)3,8034224,225
Catalan (ca)4,2515124,763
Czech (cs)4,4104574,867
German (de)20,4382,30622,744
Greek (el)4,4234894,912
Basque (eu)3,2803653,645
Persian (fa)4,0874304,517
Finnish (fi)3,3344123,746
Filipino (fil)2,8523363,188
French (fr)21,5382,31723,855
Irish (ga)3,9674704,437
Hausa (ha)4,5524995,051
Hebrew (he)4,0364534,489
Hindi (hi)4,0844784,562
Hungarian (hu)3,6224274,049
Indonesian (id)4,4354724,907
Igbo (ig)4,6325425,174
Italian (it)4,1434704,613
Japanese (ja)20,3752,34922,724
Javanese (jv)5,1986015,799
Khmer (km)3,4204213,841
Korean (ko)18,9992,03621,035
Lithuanian (lt)3,8944144,308
Malay (ms)3,1983673,565
Maltese (mt)2,8513423,193
Norwegian (no)4,5135045,017
Punjabi (pa)3,5203713,891
Polish (pl)2,6202932,913
Russian (ru)4,6494955,144
Slovak (sk)4,2924724,764
Swahili (sw)4,4454794,924
Tamil (ta)3,4034153,818
Telugu (te)3,4624113,873
Thai (th)4,0854514,536
Turkish (tr)3,4264073,833
Ukrainian (uk)4,1584624,620
Urdu (ur)3,2913503,641
Vietnamese (vi)4,6115085,119
Yoruba (yo)4,0234434,466
Chinese (zh)4,3294634,792
Zulu (zu)3,9914474,438
Total286,388

Load

python
from datasets import concatenate_datasets, get_dataset_config_names, load_dataset

# one language
ds = load_dataset("CohereLabs/tiny-aya-l2-thinker-multilingual-reasoning", "ar")

# every language
configs = get_dataset_config_names("CohereLabs/tiny-aya-l2-thinker-multilingual-reasoning")
all_langs = concatenate_datasets(
    [load_dataset("CohereLabs/tiny-aya-l2-thinker-multilingual-reasoning", name, split="train") for name in configs]
)

Columns

  • id: {language_code}-{domain}-{index} (for example ar-math-000001)
  • language, language_code: full name and ISO code
  • domain: math, science, or general
  • question, thinking, output in the given language
  • original_question, original_thinking, original_output: English source