CoolFace
Datasetpublic

mari-lab/mari-monolingual-corpus

A monolingual corpus of the Mari language in various genres, containing over 20 million word occurrences. The presented genres: Genre Russian English мутер словарь dictionary газетысе увер газетные новости periodical news прозо проза prose фольклор фольклор folklore публицистике публицистика publicistic literature поэзий поэзия poetry трагикомедий трагикомедия tragicomedy пьесе пьеса play драме драма drama комедий-водевиль водевиль vaudeville комедий комедия… See the full description on the dataset page: https://huggingface.co/datasets/mari-lab/mari-monolingual-corpus.

sourceHugging Faceupdated 3y agoView on Hugging Face
4likes29downloads
Dataset Card

A monolingual corpus of the Mari language in various genres, containing over 20 million word occurrences.

The presented genres:

GenreRussianEnglish
мутерсловарьdictionary
газетысе увергазетные новостиperiodical news
прозопрозаprose
фольклорфольклорfolklore
публицистикепублицистикаpublicistic literature
поэзийпоэзияpoetry
трагикомедийтрагикомедияtragicomedy
пьесепьесаplay
драмедрамаdrama
комедий-водевильводевильvaudeville
комедийкомедияcomedy
йоча ойлымаш-влакдетские рассказысhildren's stories
сценарийсценарийscenario
йомаксказкаfairytale
БиблийБиблияBible
повестьповестьnovel
ойлымаш-влакрассказыstories
ойлымаш ден йомак-влакрассказы и сказкиstories and fairytales
автор нергеноб автореabout the author
@inproceedings{
title={Mari monolingual corpus},
author={Andrei Chemyshev, Gennadii Sabantsev, Nadezhda Timofeeva, Vasilii Semenov},
year={2023}
}