CoolFace
Datasetpublic

alex73/benchmarks-stress-bel

Пазначэнне націскаў у беларускіх амографах (Датасэты і Бэнчмаркі) Summary: This repository provides datasets and benchmark results for evaluating stress prediction in Belarusian homographs. It features three datasets (CommonVoice, a balanced 10x10 synthetic dataset, and a fully manually annotated literary text) to test context-aware stress assignment. The repository also includes benchmark results comparing statistical methods with state-of-the-art LLM-based approaches… See the full description on the dataset page: https://huggingface.co/datasets/alex73/benchmarks-stress-bel.

sourceHugging Facecc-by-sa-4.0updated 1mo agoView on Hugging Face
0likes98downloads
Dataset Card

Пазначэнне націскаў у беларускіх амографах (Датасэты і Бэнчмаркі)

Summary: This repository provides datasets and benchmark results for evaluating stress prediction in Belarusian homographs. It features three datasets (CommonVoice, a balanced 10x10 synthetic dataset, and a fully manually annotated literary text) to test context-aware stress assignment. The repository also includes benchmark results comparing statistical methods with state-of-the-art LLM-based approaches developed for the open-source BelVoice speech synthesis framework.

Гэтыя датасэты і вынікі тэставання (benchmarks) былі створаны для фрэймварка [BelVoice](https://github.com/Belarus/BelVoice) — адкрытага праекта, прысвечанага апрацоўцы і сінтэзу беларускага маўлення.

У беларускай мове расстаноўка націскаў значна ўскладняецца наяўнасцю амографаў (слоў, якія пішуцца аднолькава, але маюць розны націск у залежнасці ад кантэксту і значэння).

Гэты рэпазітар утрымлівае датасэты для тэставання розных метадаў вызначэння націску ў амографах, а таксама вынікі тэставання метадаў, рэалізаваных у BelVoice.

🗂 Структура датасэтаў

Ацэнка якасці прагназавання націску праводзіцца на трох розных датасэтах (знаходзяцца ў каталозе datasets/):

  1. 1.CommonVoice (common_voice.txt) Збор найбольш частотных амографаў з аднайменнага датасэта Mozilla Common Voice для распазнавання маўлення. Асаблівасць: Моцная незбалансаванасць размеркавання — некаторыя варыянты аманіміі ў ім увогуле не сустракаюцца.
  1. 1.10/10 (10x10.tsv) Спецыяльна створаны экспертамі сінтэтычны датасэт. У ім кожны варыянт націску амографа (і найбольш часты, і рэдкі) прадстаўлены роўна 10 прыкладамі. Асаблівасць: Ідэальна падыходзіць для праверкі таго, ці сапраўды даследчая мадэль разумее кантэкст, а не проста выбірае самы папулярны варыянт.
  1. 1.Zascienak (zascienak_Malinauka.txt) Першыя 15 раздзелаў кнігі Аркадзя Чарнышэвіча «Засценак Малінаўка» з цалкам ручной разметкай націскаў. Асаблівасць: Прадстаўляе «натуральнае» жывое тэкставае асяроддзе і класічную літаратурную лексіку.

🛠 Падыходы да вырашэння задачы ў BelVoice

У праекце BelVoice (вынікі ў каталозе benchmark_results/) рэалізаваныя два асноўныя падыходы для развязання аманіміі:

  1. 1.Статыстычны (StressStat) Базіруецца на слоўніку найбольш частотных варыянтаў. Не патрабуе доступу да знешніх сэрвісаў і працуе вельмі хутка. Дае якасць каля 92% на натуральных тэкстах.
  1. 1.З дапамогай LLM (StressLLM) Вузкаспецыялізаваныя нейрасеткі дрэнна спраўляюцца з вызначэннем націску ў кантэксце. Лепшы падыход — стварэнне аптымізаваных промптаў з правіламі для LLM.

Рэкамендацыі па мадэлях для інферэнсу

У якасці аптымальнай мадэлі па суадносінах «якасць/хуткасць» мы раім выкарыстоўваць Gemma 4-31B (без функцыі разважання/thinking). Яна робіць усяго некалькі памылак на тысячу амографаў у літаратурным тэксце. Таксама выдатна паказала сябе прапрыетарная Gemini 3.1 Flash Lite.


📊 Вынікі тэставання (Benchmarks)

Увага: лічбы ў табліцы адлюстроўваюць дакладнасць вызначэння націску толькі для вядомых амографаў, а не для ўсіх слоў у тэксце (націск для звычайных слоў беспамылкова ставіцца праз Граматычную базу).

Метад/Мадэль**CommonVoice****Zascienak****10/10**
Stat (Статыстычны)85.49% ¹92.19%~50.00% ²
LLM: Gemma4-31B99.30%99.72%99.47%
LLM: Gemma4-26a4B96.21%98.17%97.53%
LLM: Gemini 3.1 FlashLite99.23%99.81%98.66%
LLM: Gemini 3.5 FlashLite97.68%97.78%98.20%
LLM: Qwen3.8-27B95.96%97.71%97.53%
LLM: Llama4 Maverick94.55%94.85%92.04%
LLM: Mistral-small-479.53%83.30%72.80%

Заўвагі:

  1. 1.Вынік прагназавання метадам частотнай статыстыкі паказвае не столькі якасць метаду, колькі ступень незбалансаванасці самога датасэта CommonVoice. Розніца з вынікам на звычайным тэксце (92.19% у «Засценку Малінаўка») гэта паказвае.
  2. 2.З-за таго, што датасэт 10/10 строга збалансаваны (50% сказаў на адзін варыянт націску, 50% на другі), статыстычны выбар заўсёды будзе даваць вынік роўна ў 50%.

Падрабязныя вынікі па кожным слове даступныя ў фармаце JSONL у каталозе benchmark_results/.


⚙️ Метадалогія збору промптаў (Prompt Engineering)

Для стварэння промптаў для мадэляў-аналізатараў накшталт Gemma 4 мы выкарыстоўвалі падыход «мадэлі-настаўніка»:

  1. 1.Інфармацыя пра значэнні з Граматычнай базы і Тлумачальнага слоўніка даецца вялікай мадэлі (напрыклад, Gemini Pro 3.1).
  2. 2.Яна фарміруе кампактны і аптымізаваны промпт з выразнымі правіламі для невялікай інферэнс-мадэлі.
  3. 3.Выніковы промпт праганяецца на наяўных датасэтах. Пры вялікай колькасці памылак ён дапрацоўваецца.