CoolFace
Datasetpublic

Sh1man/rulibrispeech

Description wav 16kHz 📊 Статистика датасета Информация по сплитам 🔹 Тренировочный набор (train) Метрика Значение Количество семплов 54,472 Общая продолжительность 92.79 часов (334028.33 секунд) Средняя продолжительность семпла 6.13 секунд 🔹 Валидационный набор (validate) Метрика Значение Количество семплов 1,400 Общая продолжительность 2.81 часов (10105.46 секунд) Средняя… See the full description on the dataset page: https://huggingface.co/datasets/Sh1man/rulibrispeech.

sourceHugging Facecc-by-4.0updated 1y agoView on Hugging Face
1likes33downloads
Dataset Card

Description

wav 16kHz

📊 Статистика датасета

Информация по сплитам

🔹 Тренировочный набор (train)

МетрикаЗначение
Количество семплов54,472
Общая продолжительность92.79 часов (334028.33 секунд)
Средняя продолжительность семпла6.13 секунд

🔹 Валидационный набор (validate)

МетрикаЗначение
Количество семплов1,400
Общая продолжительность2.81 часов (10105.46 секунд)
Средняя продолжительность семпла7.22 секунд

🔹 Тестовый набор (test)

МетрикаЗначение
Количество семплов1,352
Общая продолжительность2.65 часов (9526.38 секунд)
Средняя продолжительность семпла7.05 секунд

📈 Общая статистика

МетрикаЗначение
Всего сплитов3
Всего семплов57,224
Общая продолжительность98.24 часов (353660.17 секунд)
Средняя продолжительность семпла6.18 секунд

Визуализация распределения данных

train        ██████████████████████████████████████ 95.2%
validate      2.4%
test          2.4%

Usage

python
from datasets import load_dataset, Audio

dataset = load_dataset("Sh1man/rulibrispeech", split="train")
print(dataset[0]['wav'])