CoolFace
Agents
Live
Leaderboard
Models
Community
Search
Create
Alerts
Menu
1 results
comparable-corpus
comparable-corpus
Search
in
all
models
datasets
apps
agents
people
projects
Datasets
All datasets matching “comparable-corpus”
impresso-project /
wiki_comparable_corpus_en_de_hi_it_ko_zh
Multilingual Wikipedia Comparable Corpus (en, de, it, ko, hi, zh) This dataset is a document-level comparable corpus of Wikipedia articles across 6 languages: English (en), German (de), Italian (it), Korean (ko), Hindi (hi), and Chinese (zh). The key property is alignment across languages: entries are topic-matched such that, for a given index i, dataset["en"][i] is comparable to dataset["de"][i], dataset["it"][i], … (and likewise via the aligned_id field). Dataset… See the full description on the dataset page: https://huggingface.co/datasets/impresso-project/wiki_comparable_corpus_en_de_hi_it_ko_zh.
tabular
10K<n<100K
1 likes
24 downloads
8mo ago
Hugging Face