datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
ramanv-tts-all-raw
ramanv-tts-all-raw
Multi-source speech corpus for ASR/STT training. Real human speech across 60+ languages.
dia-AMICorpus-all
AMI Meeting Corpus — Full Mirror (Mix-Headset + manual annotations)
Miroir complet du AMI Meeting Corpus distribué par l'AMI Consortium
(Edinburgh). Tous les fichiers sont repris tels quels depuis la distribution
upstream, y compris la structure de dossiers.
Contenu
171 meetings (~100 h d'audio) — scénarios scénarisés (ES/IS/TS) et
réunions naturelles (EN/IB/IN)
Audio Mix-Headset : amicorpus/<meeting>/audio/<meeting>.Mix-Headset.wav
— mixdown des micros serre-tête (un… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/dia-AMICorpus-all.dia-ICSIMeetingCorpus-all
ICSI Meeting Corpus — Full Mirror (signals + annotations)
Miroir complet du ICSI Meeting Corpus distribué par l'AMI Consortium
(Edinburgh). Tous les fichiers sont repris tels quels depuis la distribution
upstream, y compris la structure de dossiers.
Contenu
75 meetings de discussions scientifiques/techniques réelles (~72 h d'audio)
Signals : Signals/<meeting>/<meeting>.interaction.wav — flux audio
mixé "interaction" (le mixdown standard utilisé pour les benchmarks… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/dia-ICSIMeetingCorpus-all.kinyarwanda_afrivoice_all_domains_v0.1
Afrivoice Kinyarwanda — All Domains
Combined dataset across 5 domains from the original source.
Note: the source dataset also includes a scripted_education domain, excluded
here due to a cluster of corrupted audio files in one of its shards.
Attribution
Original dataset: DigitalUmuganda/Afrivoice_Kinyarwanda
License: CC-BY-4.0
Attribution: Digital Umuganda
This dataset is derived from the above source and released under the same CC-BY-4.0 license.… See the full description on the dataset page: https://huggingface.co/datasets/ElizabethMwangi/kinyarwanda_afrivoice_all_domains_v0.1.fleurs-r-neucodec-all-languages
FLEURS-R NeuCodec All Languages
FLEURS-R metadata, source audio and precomputed NeuCodec speech tokens for 102
locales, plus a speaker label FLEURS itself does not ship.
Layout
data/{locale}-{split}.parquet — metadata, one row per utterance (this is what the
viewer shows).
audio/{locale}-{split}.zip — source FLEURS-R audio, 24kHz mono PCM16 WAV, members
named audio/{locale}/{split}/{id}.wav (the path column).
neucodec/{locale}-{split}-rank{N}.zip — NeuCodec… See the full description on the dataset page: https://huggingface.co/datasets/malaysia-ai/fleurs-r-neucodec-all-languages.LugandaSoloSpeech_1K
LugandaSoloSpeech1K
1,000+ Hours of single-speaker(s) Unlabeled Luganda Speech Dataset. Perfect for Speech-To-Text / ASR.
Audio quality varies from good to noisy & background music.
Dataset Details
Format: MP3, Mono, 64kbps, 16KHz
Size: 42GB
Data Sources
Radio shows, Youtube
yanka_bryl_ptushki_i_gne_zdy_all
Птушкі і гнёзды
Аўтар / Author: Янка БрыльМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
5,051
Працягласць
17 гадз 2 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)… See the full description on the dataset page: https://huggingface.co/datasets/fosters/yanka_bryl_ptushki_i_gne_zdy_all.ivan_shamyakin_tryvozhnae_shchastse_all
Трывожнае шчасце
Аўтар / Author: Іван ШамякінМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
8,298
Працягласць
28 гадз 1 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)… See the full description on the dataset page: https://huggingface.co/datasets/fosters/ivan_shamyakin_tryvozhnae_shchastse_all.persianvox_all
PersianVox: A Prosody-Aware Approach for Speech Dataset Generation from In-the-Wild Data
PersianVox-All is the larger, less-filtered counterpart of PersianVox: a multi-speaker Persian (Farsi) speech corpus automatically mined from in-the-wild unlabeled data. It contains every utterance that passed language and speech-quality (MOS) filtering, without the additional dual-ASR transcript-agreement filtering applied to the main PersianVox release. It is therefore substantially… See the full description on the dataset page: https://huggingface.co/datasets/saeedzou/persianvox_all.ivan_shamyakin_sertsa_na_daloni_all
Сэрца на далоні
Аўтар / Author: Іван ШамякінМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
7,083
Працягласць
22 гадз 58 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)… See the full description on the dataset page: https://huggingface.co/datasets/fosters/ivan_shamyakin_sertsa_na_daloni_all.kuzma_chorny_zyamlya_all
Зямля
Аўтар / Author: Кузьма ЧорныМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
7,999
Працягласць
25 гадз 35 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text —… See the full description on the dataset page: https://huggingface.co/datasets/fosters/kuzma_chorny_zyamlya_all.eryh_maryya_remark_all
Заўвага
Аўтар / Author: Эрых Марыя РэмаркМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
5,853
Працягласць
18 гадз 56 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)… See the full description on the dataset page: https://huggingface.co/datasets/fosters/eryh_maryya_remark_all.kuzma_chorny_poshuki_buduchyni_all
Пошукі будучыні
Аўтар / Author: Кузьма ЧорныМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
6,611
Працягласць
21 гадз 25 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)… See the full description on the dataset page: https://huggingface.co/datasets/fosters/kuzma_chorny_poshuki_buduchyni_all.astryd_lindgren_braty_lvinae_sertsa_all
Браты Ільвінае сэрца
Аўтар / Author: Астрыд ЛіндгрэнМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
2,116
Працягласць
6 гадз 31 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона… See the full description on the dataset page: https://huggingface.co/datasets/fosters/astryd_lindgren_braty_lvinae_sertsa_all.bely_klyck_all
Белы Клык
Аўтар / Author: Джэк ЛонданМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
2,056
Працягласць
5 гадз 20 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text —… See the full description on the dataset page: https://huggingface.co/datasets/fosters/bely_klyck_all.yakub_kolas_novaya_zyamlya_all
Новая зямля
Аўтар / Author: Якуб КоласМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
2,259
Працягласць
7 гадз 48 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text —… See the full description on the dataset page: https://huggingface.co/datasets/fosters/yakub_kolas_novaya_zyamlya_all.luganda_bible_audio_100Hrs
Luganda Bible Audio 100Hrs
Audio split by chapters of Old & New Testament & Transcripts
Format: 64kps, MP3
Requires further splitting of the audio into smaller chunks/splits (https://github.com/facebookresearch/fairseq/tree/main/examples/mms/data_prep)
Audio sourced from https://www.faithcomesbyhearing.com/
viktar_prau_dzin_all
Зборнік
Аўтар / Author: Віктар ПраўдзінМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
1,212
Працягласць
3 гадз 58 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text —… See the full description on the dataset page: https://huggingface.co/datasets/fosters/viktar_prau_dzin_all.ernest_heminguei_stary_chalavek_i_mora_all
Стары чалавек і мора
Аўтар / Author: Эрнэст ХемінгуэйМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
1,238
Працягласць
4 гадз 6 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона… See the full description on the dataset page: https://huggingface.co/datasets/fosters/ernest_heminguei_stary_chalavek_i_mora_all.vasil_bykau_all
Зборнік
Аўтар / Author: Васіль БыкаўМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
1,714
Працягласць
5 гадз 40 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text —… See the full description on the dataset page: https://huggingface.co/datasets/fosters/vasil_bykau_all.MakerereRadioSpeech_20Hrs
Dataset Card for Dataset Name
Luganda Radio Speech dataset, 20 hours of human transcribed radio speech.The audio is 16kHZ, mono channel and with 16 bit rate. cleaned.csv contains cleaned transcripts and uncleaned.csv contains uncleaned transcripts
eryh_raspe_prygody_barona_myunhau_zena_all
Прыгоды барона Мюнхаўзена
Аўтар / Author: Эрых РаспэМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
586
Працягласць
1 гадз 56 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона… See the full description on the dataset page: https://huggingface.co/datasets/fosters/eryh_raspe_prygody_barona_myunhau_zena_all.knihi-be-arlou_sny_impieratara_all
AudioSet Pipeline Output
Мова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
870
Працягласць
2 гадз 50 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text — транскрыпцыя… See the full description on the dataset page: https://huggingface.co/datasets/fosters/knihi-be-arlou_sny_impieratara_all.knihi-be-jan_barsceuski_slachcic_zavalnia_all
AudioSet Pipeline Output
Мова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
3,494
Працягласць
11 гадз 56 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text — транскрыпцыя… See the full description on the dataset page: https://huggingface.co/datasets/fosters/knihi-be-jan_barsceuski_slachcic_zavalnia_all.mar_yan_duksa_all
Зборнік
Аўтар / Author: Мар'ян ДуксаМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
331
Працягласць
1 гадз 3 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text —… See the full description on the dataset page: https://huggingface.co/datasets/fosters/mar_yan_duksa_all.kuzma_chorny_makarkavyh_volka_all
Макаркавых Волка
Аўтар / Author: Кузьма ЧорныМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
170
Працягласць
34 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text —… See the full description on the dataset page: https://huggingface.co/datasets/fosters/kuzma_chorny_makarkavyh_volka_all.swahili_afrivoice_all_domains_v0.1
Afrivoice Swahili — All Domains
Combined dataset across all 5 domains from the original source.
Attribution
Original dataset: DigitalUmuganda/Afrivoice_SwahiliLicense: CC-BY-4.0Attribution: DigitalUmuganda
This dataset is derived from the above source and released under the same CC-BY-4.0 license.
Domains
Agriculture (~124k train samples)
Education (~69k train samples)
Financial (~104k train samples)
Government (~99k train samples)
Health (~118k… See the full description on the dataset page: https://huggingface.co/datasets/ElizabethMwangi/swahili_afrivoice_all_domains_v0.1.andre_marua_pakaranne_zolatam_all
Пакаранне залатам
Аўтар / Author: Андрэ МаруаМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
119
Працягласць
24 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text —… See the full description on the dataset page: https://huggingface.co/datasets/fosters/andre_marua_pakaranne_zolatam_all.knihi-be-janka_bryl_halia_all
AudioSet Pipeline Output
Мова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
303
Працягласць
1 гадз
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text — транскрыпцыя (Gemini… See the full description on the dataset page: https://huggingface.co/datasets/fosters/knihi-be-janka_bryl_halia_all.shata_rustaveli_vitsyaz_u_tygravai_shkury_all
Віцязь у тыгравай скуры
Аўтар / Author: Шата РуставеліМова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
1,091
Працягласць
3 гадз 24 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона… See the full description on the dataset page: https://huggingface.co/datasets/fosters/shata_rustaveli_vitsyaz_u_tygravai_shkury_all.
