Vikhrmodels/ToneSlavic
ToneSlavic ToneSlavic — это датасет, собранный из русских, белорусских и украинских сплитов датасета Common Voice Corpus 21.0. В выборку вошли только фразы из файлов validated.tsv. Описание Для каждого примера предоставляются: Ссылка на MP3-файл (audio) Текстовая расшифровка (text) Язык примера (locale) ru — русский be — белорусский uk — украинский В датасете представлены следующие статистики по сплитам и языкам: Train (1 475 164 строк, 1 968.22 часов… See the full description on the dataset page: https://huggingface.co/datasets/Vikhrmodels/ToneSlavic.
ToneSlavic
ToneSlavic — это датасет, собранный из русских, белорусских и украинских сплитов датасета Common Voice Corpus 21.0. В выборку вошли только фразы из файлов validated.tsv.
Описание
Для каждого примера предоставляются:
- Ссылка на MP3-файл (
audio) - Текстовая расшифровка (
text) - Язык примера (
locale) ru— русскийbe— белорусскийuk— украинский
В датасете представлены следующие статистики по сплитам и языкам:
- Train (1 475 164 строк, 1 968.22 часов аудио):
ru: 156 576 строк ( 223.27 ч)be: 1 247 914 строк (1 653.54 ч)uk: 70 674 строк ( 91.42 ч)
- Validation (126 535 строк, 168.93 часов аудио):
ru: 13 428 строк ( 19.13 ч)be: 106 943 строк (141.82 ч)uk: 6 164 строк ( 7.97 ч)
Формат записи (JSON)
{
"audio": "https://.../train/0000079.mp3",
"text": "Па ёй можна было перамяшчацца толькі пешшу, на конях ці на мулах.",
"locale": "be"
}Пример использования
from datasets import load_dataset
ds = load_dataset("Vikhrmodels/ToneSlavic")