bashkorttele/broadcast-speech
Bashkir Broadcast Speech — Radio and Television 53.3 hours of speech in 293 recordings in the Bashkir language, from television and radio programmes produced by two public broadcasters of the Republic of Bashkortostan. Audio only — no transcripts in this release — which makes the set suitable for self-supervised speech pretraining for a low-resource Turkic language. 🌐 Languages of this card: English · Башҡортса · Русский Part of the Bashkorttele dataset series — preservation… See the full description on the dataset page: https://huggingface.co/datasets/bashkorttele/broadcast-speech.
Bashkir Broadcast Speech — Radio and Television
53.3 hours of speech in 293 recordings in the Bashkir language, from television and radio programmes produced by two public broadcasters of the Republic of Bashkortostan. Audio only — no transcripts in this release — which makes the set suitable for self-supervised speech pretraining for a low-resource Turkic language.
🌐 Languages of this card: English · Башҡортса · Русский
Part of the Bashkorttele dataset series — preservation and digital development of the Bashkir language.
⚠️ The licence covers the speech and the text, but not illustrations, graphic design or musical design. See the Licence section.
English
Bashkir Broadcast Speech — Radio and Television
53.3 hours of speech in 293 recordings in the Bashkir language, from television and radio programmes produced by two public broadcasters of the Republic of Bashkortostan. Audio only — no transcripts in this release — which makes the set suitable for self-supervised speech pretraining for a low-resource Turkic language.
At a glance
Supported tasks
- automatic-speech-recognition
- text-to-speech
- audio-classification
Programmes
Dataset structure
Fields
Example record
{
"file_name": "data/tv/avtograf/0001.flac",
"organization": "bst",
"medium": "tv",
"programme_slug": "avtograf",
"programme_ru": "",
"programme_ba": "АВТОГРАФ",
"programme_year": "",
"programme_author": "",
"programme_director": "",
"title_ru": "",
"title_ba": "Автограв Разифа Динмухаметова ИИ",
"duration_s": "463.24",
"sample_rate": "48000",
"channels": "1",
"codec": "flac",
"source_codec": "aac",
"source_bitrate_kbps": "317",
"source_quality": "normal",
"transcript": ""
}Provenance
The recordings were provided by two public broadcasters of the Republic of Bashkortostan. Only the audio track was taken from the video files: video and subtitles are not part of the dataset. Recordings with identical channels were downmixed to mono losslessly and duplicates were excluded.
Licence
Released under the Community Data License Agreement – Permissive, Version 2.0 (CDLA-Permissive-2.0); the full text is in LICENSE. Rights to the underlying material were obtained under agreements with the rights holders.
Exclusion. The licence covers the speech and the text. It does not cover illustrations, graphic design or musical design — programme idents and music beds, artwork, and the typographic design of the publications.
Known limitations
- no transcripts: the
transcriptfield is reserved but empty in this release - the recordings may contain individual Russian words and phrases
Personal and sensitive information
The dataset is assembled from published editions and broadcast material. Names of authors and of people written about do appear in it — exactly as they were printed or said on air.
Citation
CDLA-Permissive-2.0 does not require attribution: its only condition is that the text of the agreement, or a link to it, travels with the data. If you would like to cite the dataset anyway, a link is enough: https://huggingface.co/datasets/bashkorttele/broadcast-speech
@misc{bashkorttele_broadcast_speech_2026,
title = {Bashkir Broadcast Speech — Radio and Television},
author = {Bashkorttele (башҡорттеле), Foundation for the Preservation and Development of the Bashkir Language},
year = {2026},
url = {https://huggingface.co/datasets/bashkorttele/broadcast-speech},
note = {Licensed under CDLA-Permissive-2.0}
}Links
- Foundation for the Preservation and Development of the Bashkir Language
- Bashkorttele на Hugging Face
- JSC "TRK Bashkortostan" (BST)
- FSUE VGTRK, GTRK "Bashkortostan"
Башҡортса
Башҡорт телендәге эфир яҙмалары — радио һәм телевидение
двух вещателей Республики Башкортостан тарафынан әҙерләнгән тел-радио тапшырыуҙарынан алынған башҡорт телендәге һөйләш: 293 яҙма, 53.3 сәғәт. Тик тауыш, транскриптарһыҙ — шуға күрә йыйылма, беренсе сиратта, ресурстары аҙ төрки теле өсөн һөйләш моделдәрен үҙ аллы алдан уҡытыуға ярай.
Ҡыҫҡаса
Ҡулланыу өлкәләре
- automatic-speech-recognition
- text-to-speech
- audio-classification
Тапшырыуҙар
Датасеттың төҙөлөшө
Яҙма ҡырҙары
Яҙма өлгөһө
{
"file_name": "data/tv/avtograf/0001.flac",
"organization": "bst",
"medium": "tv",
"programme_slug": "avtograf",
"programme_ru": "",
"programme_ba": "АВТОГРАФ",
"programme_year": "",
"programme_author": "",
"programme_director": "",
"title_ru": "",
"title_ba": "Автограв Разифа Динмухаметова ИИ",
"duration_s": "463.24",
"sample_rate": "48000",
"channels": "1",
"codec": "flac",
"source_codec": "aac",
"source_bitrate_kbps": "317",
"source_quality": "normal",
"transcript": ""
}Материалдың сығанағы
Яҙмалар Башҡортостан Республикаһының ике тапшырыусы ойошмаһы тарафынан бирелде. Видеофайлдарҙан бары тик тауыш юлы ғына алынды: видео һәм субтитрҙар датасетҡа инмәй. Бер иш каналлы яҙмалар юғалтыуһыҙ моно форматына күсерелде, ҡабатланғандары төшөрөп ҡалдырылды.
Лицензия
Датасет Community Data License Agreement – Permissive, Version 2.0 (CDLA-Permissive-2.0) буйынса таратыла; тулы тексты — LICENSE файлында. Сығанаҡ материалдарға хоҡуҡтар хоҡуҡ эйәләре менән төҙөлгән килешеүҙәр буйынса алынған.
Иҫкәрмә. Лицензия һөйләмәгә һәм текстҡа ҡағыла. Ул иллюстрацияларға, график һәм музыкаль биҙәлешкә ҡағылмай — тапшырыуҙарҙың заставкаларына һәм музыкаль фонына, баҫмаларҙың рәсемдәренә һәм нәфис вёрсткаһына.
Билдәле сикләүҙәр
- текст яҙмалары юҡ:
transcriptҡыры ҡалдырылған, ләкин был сығарылышта буш - аудиояҙмаларҙа рус телендәге айырым һүҙҙәр һәм һөйләмдәр булырға мөмкин
Шәхси мәғлүмәт
Датасет баҫылып сыҡҡан баҫмаларҙан һәм эфир материалдарынан йыйылған. Авторҙарҙың һәм яҙылған кешеләрҙең исемдәре унда бар — баҫылған йәки эфирҙа әйтелгән килеш.
Һылтанма яһау
CDLA-Permissive-2.0 лицензияһы авторлыҡты күрһәтеүҙе талап итмәй: уның берҙән-бер шарты — мәғлүмәт менән бергә килешеү тексын йәки уға һылтанманы тапшырыу. Шулай ҙа һылтанма яһарға теләһәгеҙ, датасетҡа һылтанма етә: https://huggingface.co/datasets/bashkorttele/broadcast-speech
@misc{bashkorttele_broadcast_speech_2026,
title = {Bashkir Broadcast Speech — Radio and Television},
author = {Bashkorttele (башҡорттеле), Foundation for the Preservation and Development of the Bashkir Language},
year = {2026},
url = {https://huggingface.co/datasets/bashkorttele/broadcast-speech},
note = {Licensed under CDLA-Permissive-2.0}
}Һылтанмалар
- «Башҡорт телен һаҡлау һәм үҫтереү фонды» АХО
- Bashkorttele на Hugging Face
- Башҡортостан юлдаш телевидениеһы
- «Башҡортостан» дәүләт телевизион һәм радио компанияһы
Русский
Эфирные записи на башкирском языке — радио и телевидение
53.3 ч речи в 293 записях на башкирском языке — теле- и радиопередачи двух организаций вещателей Республики Башкортостан. Только звук, без транскриптов: датасет предназначен прежде всего для самообучаемого предобучения речевых моделей.
Сводка
Задачи
- automatic-speech-recognition
- text-to-speech
- audio-classification
Передачи
Структура датасета
Поля записи
Пример записи
{
"file_name": "data/tv/avtograf/0001.flac",
"organization": "bst",
"medium": "tv",
"programme_slug": "avtograf",
"programme_ru": "",
"programme_ba": "АВТОГРАФ",
"programme_year": "",
"programme_author": "",
"programme_director": "",
"title_ru": "",
"title_ba": "Автограв Разифа Динмухаметова ИИ",
"duration_s": "463.24",
"sample_rate": "48000",
"channels": "1",
"codec": "flac",
"source_codec": "aac",
"source_bitrate_kbps": "317",
"source_quality": "normal",
"transcript": ""
}Происхождение материала
Записи предоставлены двумя организациями вещателями Республики Башкортостан. Из видеофайлов взята только звуковая дорожка: видео и субтитры в датасет не входят. Записи с идентичными каналами сведены в моно без потерь, дубликаты исключены.
Лицензия
Датасет распространяется по Community Data License Agreement – Permissive, Version 2.0 (CDLA-Permissive-2.0); полный текст — в файле LICENSE. Права на исходные материалы получены по договорам с правообладателями.
Оговорка. Лицензия распространяется на речь и текст. Она не распространяется на иллюстрации, графическое и музыкальное оформление — заставки и музыкальные подложки передач, рисунки и художественную вёрстку изданий.
Известные ограничения
- расшифровок нет: поле
transcriptзарезервировано, но в этом выпуске пусто - аудиозаписи могут содержать отдельные слова и фразы на русском языке
Персональные данные
Датасет собран из опубликованных изданий и эфирных материалов. Имена авторов и героев публикаций в нём есть — ровно в том виде, в каком они были напечатаны или произнесены в эфире.
Цитирование
Лицензия CDLA-Permissive-2.0 не требует указывать авторство: единственное её условие — передавать вместе с данными текст соглашения или ссылку на него. Если вы всё же хотите сослаться, достаточно ссылки на датасет: https://huggingface.co/datasets/bashkorttele/broadcast-speech
@misc{bashkorttele_broadcast_speech_2026,
title = {Bashkir Broadcast Speech — Radio and Television},
author = {Bashkorttele (башҡорттеле), Foundation for the Preservation and Development of the Bashkir Language},
year = {2026},
url = {https://huggingface.co/datasets/bashkorttele/broadcast-speech},
note = {Licensed under CDLA-Permissive-2.0}
}