CoolFace
Datasetpublic

Vikhrmodels/ToneSlavic

ToneSlavic ToneSlavic — это датасет, собранный из русских, белорусских и украинских сплитов датасета Common Voice Corpus 21.0. В выборку вошли только фразы из файлов validated.tsv. Описание Для каждого примера предоставляются: Ссылка на MP3-файл (audio) Текстовая расшифровка (text) Язык примера (locale) ru — русский be — белорусский uk — украинский В датасете представлены следующие статистики по сплитам и языкам: Train (1 475 164 строк, 1 968.22 часов… See the full description on the dataset page: https://huggingface.co/datasets/Vikhrmodels/ToneSlavic.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes289downloads
Dataset Card

ToneSlavic

ToneSlavic — это датасет, собранный из русских, белорусских и украинских сплитов датасета Common Voice Corpus 21.0. В выборку вошли только фразы из файлов validated.tsv.


Описание

Для каждого примера предоставляются:

  1. 1.Ссылка на MP3-файл (audio)
  2. 2.Текстовая расшифровка (text)
  3. 3.Язык примера (locale)
  4. 4.ru — русский
  5. 5.be — белорусский
  6. 6.uk — украинский

В датасете представлены следующие статистики по сплитам и языкам:

  • —Train (1 475 164 строк, 1 968.22 часов аудио):
  • —ru: 156 576 строк ( 223.27 ч)
  • —be: 1 247 914 строк (1 653.54 ч)
  • —uk: 70 674 строк ( 91.42 ч)
  • —Validation (126 535 строк, 168.93 часов аудио):
  • —ru: 13 428 строк ( 19.13 ч)
  • —be: 106 943 строк (141.82 ч)
  • —uk: 6 164 строк ( 7.97 ч)

Формат записи (JSON)

json
{
  "audio": "https://.../train/0000079.mp3",
  "text": "Па ёй можна было перамяшчацца толькі пешшу, на конях ці на мулах.",
  "locale": "be"
}

Пример использования

python
from datasets import load_dataset

ds = load_dataset("Vikhrmodels/ToneSlavic")