tiennguyenbnbk/gopt-vh-gold
VuiHoc GOPT Gold — audio + consensus labels (Arrow) 6,361 cau IELTS read-aloud thuan sach (~35h) tu he thong VuiHoc, moi row gom audio + nhan dong thuan 3 vendor (SpeechAce, SpeechSuper, iFlytek ISE), thang nghiep vu [0.0, 100.0], chia 4 split zero-leakage. Splits Split Mau Speakers Phone valid Word valid train 4,643 812 94.25% 98.25% val 581 100 94.28% 98.32% test_unseen_speakers 580 94 94.2% 98.13% test_unseen_prompts 557 190 93.2% 97.77%… See the full description on the dataset page: https://huggingface.co/datasets/tiennguyenbnbk/gopt-vh-gold.
VuiHoc GOPT Gold — audio + consensus labels (Arrow)
6,361 cau IELTS read-aloud thuan sach (~35h) tu he thong VuiHoc, moi row gom audio + nhan dong thuan 3 vendor (SpeechAce, SpeechSuper, iFlytek ISE), thang nghiep vu [0.0, 100.0], chia 4 split zero-leakage.
Splits
- Speaker khong giao nhau giua train / val / testunseenspeakers.
- testunseenprompts dung 7 de bai hoan toan moi (speaker co the trung train).
Schema (moi row)
Quy uoc quan trong
-1/-1.0la MASK (khong co nhan), KHONG phai diem so — loc bang(label >= 0).- Phone: Median-of-3 vendor sau chuan hoa z-score ve khong gian SpeechSuper; 2 vendor chi nhan khi |dz| <= 1; nv <= 1 hoac bat dong -> mask.
- Fluency bi mask tren mot phan mau (2 vendor cham lech > 1 sigma).
GOP feature (se cap nhat)
Cot feat (CTC-GOP 80-d KoelLabs/xlsr-english-01 + occupancy) CHUA co trong version nay — se extract tu cot audio va day them len repo sau.
Load
from datasets import load_dataset
ds = load_dataset("tiennguyenbnbk/gopt-vh-gold")
ex = ds["train"][0]
ex["phone_list"], ex["utt_heads"] # bang tra nam ngay trong row