uros69/serbian-llm-bench
0
Serbian LLM Benchmark
Koliko mali open-source modeli zaista znaju srpski? Engleski leaderboardi ne mere padeže — model može biti odličan na MMLU i i dalje ne znati u koji padež ide imenica posle predloga „uprkos".
95 ručno pisanih zadataka, 6 kategorija, 7 modela, svi na temperature=0.
Ključni nalaz: padeži su zid. Prosek svih modela je 37.1%, nijedan ne prelazi 50%, a dva modela su ispod nasumičnog pogađanja (33.3%) — bolje bi prošli da su bacali novčić.
Kod, skup zadataka i harness za pokretanje: https://github.com/umilutinovic25-hash/serbian-llm-bench
