datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
knihi-be-auramcyk_u_paddziamielli_lilija_pilkievic_all
AudioSet Pipeline Output
Мова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
2,324
Працягласць
8 гадз 21 хв
Частата дыскрэтызацыі
22050 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text — транскрыпцыя… See the full description on the dataset page: https://huggingface.co/datasets/fosters/knihi-be-auramcyk_u_paddziamielli_lilija_pilkievic_all.legendy-i-padanni
Легенды і паданні
Мова / Language: Беларуская (Belarusian)
Частка калекцыі Ministerskija —
выраўнаваныя аўдыёзапісы беларускіх аўдыёкніг з транскрыпцыямі.
Апублікаваных радкоў (HF)
533
Доўгасць аўдыё
1h49m
Парог даверу
≥ 0.95
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (~15 с)
text — транскрыпцыя (Gemini + ASR выраўнаванне)
chunk_uid — унікальны ідэнтыфікатар фрагмента
Апрацоўка
Аўдыёкніга разбіта на кароткія… See the full description on the dataset page: https://huggingface.co/datasets/fosters/legendy-i-padanni.legendy-i-padanni_original
Легенды і паданні — арыгінальнае аўдыё
Мова / Language: Беларуская (Belarusian)
Арыгінальнае аўдыё без апрацоўкі, захаванае ў зыходнай якасці.
Частка калекцыі Ministerskija —
корпус беларускіх аўдыёкніг.
Апрацаваная версія (сегменты ~15 с, выраўнаваная транскрыпцыя):
legendy-i-padanni
Доўгасць аўдыё
1h49m
Радкоў у датасеце
533
Структура
Кожны радок змяшчае:
audio — арыгінальны аўдыёзапіс
text — транскрыпцыя
chunk_uid — унікальны ідэнтыфікатар… See the full description on the dataset page: https://huggingface.co/datasets/fosters/legendy-i-padanni_original.legendy-i-padanni_all
Легенды і паданні
Мова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
533
Працягласць
1 гадз 41 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text — транскрыпцыя (Gemini +… See the full description on the dataset page: https://huggingface.co/datasets/fosters/legendy-i-padanni_all.knihi-be-auramcyk_u_paddziamielli_lilija_pilkievic_output_original
AudioSet Pipeline Output — арыгінальнае аўдыё
Мова / Language: Беларуская (Belarusian)
Арыгінальнае аўдыё без апрацоўкі, захаванае ў зыходнай якасці.
Частка калекцыі Ministerskija —
корпус беларускіх аўдыёкніг.
Апрацаваная версія (сегменты ~15 с, выраўнаваная транскрыпцыя):
knihi-be-auramcyk_u_paddziamielli_lilija_pilkievic_output
Структура
Кожны радок змяшчае:
audio — арыгінальны аўдыёзапіс
text — транскрыпцыя
chunk_uid — унікальны ідэнтыфікатар… See the full description on the dataset page: https://huggingface.co/datasets/fosters/knihi-be-auramcyk_u_paddziamielli_lilija_pilkievic_output_original.
