CoolFace
Datasetpublic

nrl-ai/vn-diacritic-eval

nrl-ai/vn-diacritic-eval — 4-register Vietnamese diacritic-restoration eval A reproducible evaluation set covering four registers of Vietnamese text. Used by the nom-vn project to compare diacritic-restoration models against the public Toshiiiii1/Vietnamese_diacritics_restoration_5th SOTA on a register-balanced grid. Multi-corpus measurement is the rule — single-corpus quality numbers hide register-shift weakness. This dataset is the multi-register grid we maintain.… See the full description on the dataset page: https://huggingface.co/datasets/nrl-ai/vn-diacritic-eval.

sourceHugging Facecc-by-sa-4.0updated 5mo agoView on Hugging Face
1likes49downloads
3 commits on main
dded1e05mo ago

docs: replace internal-policy reference with self-contained explanation

vietanhdev
bfd6fb05mo ago

initial: 4-register VN diacritic eval set (1227 sentences)

vietanhdev
baaa6ad5mo ago

initial commit

vietanhdev