CoolFace
Datasetpublic

Vikhrmodels/ToneWebinars

ToneWebinars ToneWebinars — это обработанная версия ZeroAgency/shkolkovo-bobr.video-webinars-audio. Оригинальные файлы были перепаковыны в parquet формат с нарезкой по приложенным такмкодам. В датасете 2053.55 часа аудио для train сплита и 154.34 для validation. Описание Для каждого примера прдоставляются: Ссылка на MP3-файл (audio) Текстовая расшифровка (text) Частота дискретизации (sample_rate) Формат записи (JSON) { "audio":… See the full description on the dataset page: https://huggingface.co/datasets/Vikhrmodels/ToneWebinars.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
13likes771downloads
Dataset Card

ToneWebinars

ToneWebinars — это обработанная версия ZeroAgency/shkolkovo-bobr.video-webinars-audio. Оригинальные файлы были перепаковыны в parquet формат с нарезкой по приложенным такмкодам. В датасете 2053.55 часа аудио для train сплита и 154.34 для validation.


Описание

Для каждого примера прдоставляются:

  1. 1.Ссылка на MP3-файл (audio)
  2. 2.Текстовая расшифровка (text)
  3. 3.Частота дискретизации (sample_rate)

Формат записи (JSON)

json
{
  "audio": "https://.../train/00001.mp3",
  "text": "Да, ну все об этом слышали, что типа владение, то у тебя просто что-то есть, условно есть тачка, она тупо стоит в гараже. Пользование, это когда ты используешь в личных целях, то есть ты можешь покататься на этой машине, выехать там, не знаю, проехаться, приехать в школу на машине, еще что-нибудь сделать. Распоряжение, это продать.",
  "sample_rate": "48,000"
}

Пример использования

python
from datasets import load_dataset

ds = load_dataset("Vikhrmodels/ToneWebinars")