ismaelfi/melolingua-cefr-graded-multilingual-stories
MeloLingua CEFR-Graded Multilingual Stories Dataset The MeloLingua CEFR-Graded Multilingual Stories Dataset is a citable educational corpus of 118 public A1–B2 language-learning stories in German, Spanish, French, Italian, Korean, and Russian. Records include target-language text, sentence-aligned English translations, contextual vocabulary, comprehension questions, sentence-building exercises, teaching metadata, provenance, and canonical links to original lessons on MeloLingua.… See the full description on the dataset page: https://huggingface.co/datasets/ismaelfi/melolingua-cefr-graded-multilingual-stories.
MeloLingua CEFR-Graded Multilingual Stories Dataset
The MeloLingua CEFR-Graded Multilingual Stories Dataset is a citable educational corpus of 118 public A1–B2 language-learning stories in German, Spanish, French, Italian, Korean, and Russian. Records include target-language text, sentence-aligned English translations, contextual vocabulary, comprehension questions, sentence-building exercises, teaching metadata, provenance, and canonical links to original lessons on MeloLingua.
Composition
Data files
data/stories.json: complete nested recordsdata/stories.csv: one story per rowdata/sentences.csv: one aligned target-language/English sentence pair per rowdata/vocabulary.csv: one vocabulary item per rowdata/questions.csv: one comprehension question per row
Source and methodology
Version 1.0.0 is a structured snapshot of public MeloLingua graded stories published on 27 August 2026. Each record includes a canonical source URL and integrity hashes. The transformation normalizes educational fields and generates deterministic CSV views without rewriting story text or translations.
The CEFR labels are editorial teaching labels, not official test scores or proficiency certifications. For CEFR framework information, see the Council of Europe level descriptions.
Suitable uses
The dataset supports classroom reading activities, non-commercial lesson adaptations, multilingual search and retrieval, parallel-text interfaces, vocabulary-in-context analysis, educational question-answering prototypes, and research on digital graded readers.
License and citation
Dataset contents are available under CC BY-NC 4.0. Cite as:
MeloLingua CEFR-Graded Multilingual Stories Dataset, version 1.0.0, MeloLingua, 2026.
See the GitHub repository for methodology, schema, validation, attribution, and citation metadata.
