vudang449/chunkformer-large-vie
011
chunkformer-large-vie (mirror)
Mirror của khanhld/chunkformer-large-vie — ASR tiếng Việt kiến trúc ChunkFormer (~110M params, CTC, chunk-based encoder, decode long-form không giới hạn độ dài). Mirror giữ nguyên trọng số, phục vụ voice-bench. Model gốc: Khanh Le (khanhld), license CC-BY-NC-4.0. Paper: ICASSP 2025.
Số đo voice-bench (Mac Mini M4 24GB, CPU)
So sánh cùng harness: bằng PhoWhisper-large-ct2 trên VIVOS (5.50%) nhưng nhanh hơn 45×; không bị floor padding 30s của whisper — model duy nhất đạt <500ms với WER <10% trên CPU M4.
Caveat: model này train trên hầu hết dataset VN công khai kể cả VietMed_labeled và VIVOS* (xem model card gốc), nên số VietMed KHÔNG chứng minh ưu thế out-of-domain so với PhoWhisper (small 22.20%, large 25.12% — không có VietMed trong train). Đánh giá OOD sạch cần audio tự thu.
Dùng
# pip install chunkformer
from chunkformer import ChunkFormerModel
model = ChunkFormerModel.from_pretrained("vudang449/chunkformer-large-vie")
text = model.batch_decode(["audio.wav"])[0] # clip ngắn
long = model.endless_decode("long.wav", return_timestamps=False) # file dài