CoolFace
Datasetpublic

crosslingual-rule-following/canonical-dataset

canonical-dataset A parallel, multilingual dataset on rule-following Languages en — English am — Amharic de — German hi — Hindi ig — Igbo it — Italian ko — Korean ru — Russian sw — Swahili ta — Tamil tr — Turkish ur — Urdu yo — Yoruba Loading from datasets import load_dataset en = load_dataset("canonical-dataset", "en", split="test") yo = load_dataset("canonical-dataset", "yo", split="test")

sourceHugging Faceupdated 1mo agoView on Hugging Face
0likes175downloads
Dataset Card

canonical-dataset

A parallel, multilingual dataset on rule-following

Languages

  • —en — English
  • —am — Amharic
  • —de — German
  • —hi — Hindi
  • —ig — Igbo
  • —it — Italian
  • —ko — Korean
  • —ru — Russian
  • —sw — Swahili
  • —ta — Tamil
  • —tr — Turkish
  • —ur — Urdu
  • —yo — Yoruba

Loading

python
from datasets import load_dataset

en = load_dataset("canonical-dataset", "en", split="test")
yo = load_dataset("canonical-dataset", "yo", split="test")