alex73/benchmarks-stress-bel
Пазначэнне націскаў у беларускіх амографах (Датасэты і Бэнчмаркі) Summary: This repository provides datasets and benchmark results for evaluating stress prediction in Belarusian homographs. It features three datasets (CommonVoice, a balanced 10x10 synthetic dataset, and a fully manually annotated literary text) to test context-aware stress assignment. The repository also includes benchmark results comparing statistical methods with state-of-the-art LLM-based approaches… See the full description on the dataset page: https://huggingface.co/datasets/alex73/benchmarks-stress-bel.
Пазначэнне націскаў у беларускіх амографах (Датасэты і Бэнчмаркі)
Summary: This repository provides datasets and benchmark results for evaluating stress prediction in Belarusian homographs. It features three datasets (CommonVoice, a balanced 10x10 synthetic dataset, and a fully manually annotated literary text) to test context-aware stress assignment. The repository also includes benchmark results comparing statistical methods with state-of-the-art LLM-based approaches developed for the open-source BelVoice speech synthesis framework.
Гэтыя датасэты і вынікі тэставання (benchmarks) былі створаны для фрэймварка [BelVoice](https://github.com/Belarus/BelVoice) — адкрытага праекта, прысвечанага апрацоўцы і сінтэзу беларускага маўлення.
У беларускай мове расстаноўка націскаў значна ўскладняецца наяўнасцю амографаў (слоў, якія пішуцца аднолькава, але маюць розны націск у залежнасці ад кантэксту і значэння).
Гэты рэпазітар утрымлівае датасэты для тэставання розных метадаў вызначэння націску ў амографах, а таксама вынікі тэставання метадаў, рэалізаваных у BelVoice.
🗂 Структура датасэтаў
Ацэнка якасці прагназавання націску праводзіцца на трох розных датасэтах (знаходзяцца ў каталозе datasets/):
- CommonVoice (
common_voice.txt) Збор найбольш частотных амографаў з аднайменнага датасэта Mozilla Common Voice для распазнавання маўлення. Асаблівасць: Моцная незбалансаванасць размеркавання — некаторыя варыянты аманіміі ў ім увогуле не сустракаюцца.
- 10/10 (
10x10.tsv) Спецыяльна створаны экспертамі сінтэтычны датасэт. У ім кожны варыянт націску амографа (і найбольш часты, і рэдкі) прадстаўлены роўна 10 прыкладамі. Асаблівасць: Ідэальна падыходзіць для праверкі таго, ці сапраўды даследчая мадэль разумее кантэкст, а не проста выбірае самы папулярны варыянт.
- Zascienak (
zascienak_Malinauka.txt) Першыя 15 раздзелаў кнігі Аркадзя Чарнышэвіча «Засценак Малінаўка» з цалкам ручной разметкай націскаў. Асаблівасць: Прадстаўляе «натуральнае» жывое тэкставае асяроддзе і класічную літаратурную лексіку.
🛠 Падыходы да вырашэння задачы ў BelVoice
У праекце BelVoice (вынікі ў каталозе benchmark_results/) рэалізаваныя два асноўныя падыходы для развязання аманіміі:
- Статыстычны (StressStat) Базіруецца на слоўніку найбольш частотных варыянтаў. Не патрабуе доступу да знешніх сэрвісаў і працуе вельмі хутка. Дае якасць каля 92% на натуральных тэкстах.
- З дапамогай LLM (StressLLM) Вузкаспецыялізаваныя нейрасеткі дрэнна спраўляюцца з вызначэннем націску ў кантэксце. Лепшы падыход — стварэнне аптымізаваных промптаў з правіламі для LLM.
Рэкамендацыі па мадэлях для інферэнсу
У якасці аптымальнай мадэлі па суадносінах «якасць/хуткасць» мы раім выкарыстоўваць Gemma 4-31B (без функцыі разважання/thinking). Яна робіць усяго некалькі памылак на тысячу амографаў у літаратурным тэксце. Таксама выдатна паказала сябе прапрыетарная Gemini 3.1 Flash Lite.
📊 Вынікі тэставання (Benchmarks)
Увага: лічбы ў табліцы адлюстроўваюць дакладнасць вызначэння націску толькі для вядомых амографаў, а не для ўсіх слоў у тэксце (націск для звычайных слоў беспамылкова ставіцца праз Граматычную базу).
Заўвагі:
- Вынік прагназавання метадам частотнай статыстыкі паказвае не столькі якасць метаду, колькі ступень незбалансаванасці самога датасэта CommonVoice. Розніца з вынікам на звычайным тэксце (92.19% у «Засценку Малінаўка») гэта паказвае.
- З-за таго, што датасэт 10/10 строга збалансаваны (50% сказаў на адзін варыянт націску, 50% на другі), статыстычны выбар заўсёды будзе даваць вынік роўна ў 50%.
Падрабязныя вынікі па кожным слове даступныя ў фармаце JSONL у каталозе benchmark_results/.
⚙️ Метадалогія збору промптаў (Prompt Engineering)
Для стварэння промптаў для мадэляў-аналізатараў накшталт Gemma 4 мы выкарыстоўвалі падыход «мадэлі-настаўніка»:
- Інфармацыя пра значэнні з Граматычнай базы і Тлумачальнага слоўніка даецца вялікай мадэлі (напрыклад, Gemini Pro 3.1).
- Яна фарміруе кампактны і аптымізаваны промпт з выразнымі правіламі для невялікай інферэнс-мадэлі.
- Выніковы промпт праганяецца на наяўных датасэтах. Пры вялікай колькасці памылак ён дапрацоўваецца.
