datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
knihi-be-viacaslau_adamcyk_urok_aryfmietyki_output_original
AudioSet Pipeline Output — арыгінальнае аўдыё
Мова / Language: Беларуская (Belarusian)
Арыгінальнае аўдыё без апрацоўкі, захаванае ў зыходнай якасці.
Частка калекцыі Ministerskija —
корпус беларускіх аўдыёкніг.
Апрацаваная версія (сегменты ~15 с, выраўнаваная транскрыпцыя):
knihi-be-viacaslau_adamcyk_urok_aryfmietyki_output
Структура
Кожны радок змяшчае:
audio — арыгінальны аўдыёзапіс
text — транскрыпцыя
chunk_uid — унікальны ідэнтыфікатар
Ліцэнзія /… See the full description on the dataset page: https://huggingface.co/datasets/fosters/knihi-be-viacaslau_adamcyk_urok_aryfmietyki_output_original.knihi-be-viacaslau_adamcyk_urok_aryfmietyki_all
AudioSet Pipeline Output
Мова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
196
Працягласць
38 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text — транскрыпцыя (Gemini +… See the full description on the dataset page: https://huggingface.co/datasets/fosters/knihi-be-viacaslau_adamcyk_urok_aryfmietyki_all.earnings22-long-form
