fosters/mar_yan_duksa_all
Зборнік Аўтар / Author: Мар'ян ДуксаМова / Language: Беларуская (Belarusian) Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд. Частка калекцыі Belarusian Audiobooks (native). Радкоў у датасеце 331 Працягласць 1 гадз 3 хв Частата дыскрэтызацыі 44100 Hz Каналы мона Даўжыня фрагмента да 30 с Структура Кожны радок змяшчае: audio — аўдыёфрагмент (native SR, мона, ≤30 с) text —… See the full description on the dataset page: https://huggingface.co/datasets/fosters/mar_yan_duksa_all.
Зборнік
Аўтар / Author: Мар'ян Дукса Мова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд. Частка калекцыі Belarusian Audiobooks (native).
Структура
Кожны радок змяшчае:
audio— аўдыёфрагмент (native SR, мона, ≤30 с)text— транскрыпцыя (Gemini + двайное ASR выраўнаванне)duration— даўжыня фрагмента ў секундах
Апрацоўка
Аўдыёкніга разбіта на фрагменты (≤30 с) і нарэзана з арыгінальнага аўдыё ў зыходнай якасці. На краях кожнага фрагмента застаецца ≤200 мс арыгінальнай цішыні плюс 100 мс сінтэзаванай. Упэўненасць выраўнавання транскрыпцыі ≥ 0.95.
Дыктар / Speaker
Вызначана мадэллю [WavLM-Base+](https://huggingface.co/microsoft/wavlm-base-plus-sv) (cosine similarity, threshold=0.82).
Ліцэнзія / License
CC BY-NC 4.0 — дазволена выкарыстанне ў некамерцыйных мэтах з указаннем крыніцы.
