VietAudio-team/Vietnamese-asr-leaderboard
📊 Vietnamese Open ASR Evaluation Dataset Storage Kho lưu trữ dữ liệu nhãn bảo mật (Ground Truth) phục vụ cho hệ thống Vietnamese Open ASR Leaderboard. Toàn bộ dữ liệu được tổng hợp từ 9 bộ dữ liệu tiếng Việt công khai lớn nhất hiện nay, sau đó trải qua quy trình chuẩn hóa văn bản nghiêm ngặt để làm thước đo chuẩn mực đánh giá hiệu năng các mô hình nhận dạng giọng nói (ASR). [!TIP] 🚀 NỘP BÀI ĐÁNH GIÁ TẠI ĐÂY: 📈 1. Bảng Thống Kê Chi Tiết Hệ… See the full description on the dataset page: https://huggingface.co/datasets/VietAudio-team/Vietnamese-asr-leaderboard.
📊 Vietnamese Open ASR Evaluation Dataset Storage
Kho lưu trữ dữ liệu nhãn bảo mật (Ground Truth) phục vụ cho hệ thống Vietnamese Open ASR Leaderboard. Toàn bộ dữ liệu được tổng hợp từ 9 bộ dữ liệu tiếng Việt công khai lớn nhất hiện nay, sau đó trải qua quy trình chuẩn hóa văn bản nghiêm ngặt để làm thước đo chuẩn mực đánh giá hiệu năng các mô hình nhận dạng giọng nói (ASR).
<br>
[!TIP] ### 🚀 NỘP BÀI ĐÁNH GIÁ TẠI ĐÂY: <a href="https://huggingface.co/spaces/VietAudio-team/Vietnamese-ASR-Leaderboard" target="_blank"> <img src="https://img.shields.io/badge/%F0%9F%A5%87%20Hugging%20Face-Submit%20to%20Leaderboard-8a2be2?style=for-the-badge&logo=huggingface&logoColor=white&color=2ea44f" alt="Submit to Leaderboard" height="40"> </a>
📈 1. Bảng Thống Kê Chi Tiết Hệ Dữ Liệu (Dataset Statistics)
Dưới đây là bảng tổng hợp chi tiết về số lượng hàng (mẫu âm thanh), tổng thời lượng ghi âm cấu thành và tần số lấy mẫu (Sampling Rate) nguyên bản của từng tập dữ liệu thành phần:
🛠️ 2. Quy Trình Chuẩn Hóa Văn Bản (Text Normalization Pipeline)
Để đảm bảo tính nhất quán tối đa khi tính toán chỉ số lỗi từ (WER), toàn bộ phần văn bản đáp án gốc (transcription) trong kho lưu trữ này đã được xử lý tự động qua bộ tiền lọc chuẩn hóa cấu trúc ngôn ngữ:
- Chuẩn hóa ký tự & dấu câu: Giữ lại đầy đủ dấu tiếng Việt chuẩn, viết hoa các ký tự đầu câu/tên riêng theo ngữ cảnh gốc. Toàn bộ các ký tự đặc biệt rác bị loại bỏ, chỉ giữ lại 4 loại dấu câu cơ bản bao gồm: dấu phẩy (
,), dấu chấm (.), dấu chấm hỏi (?), và dấu chấm than (!). - Chuyển đổi số thành chữ (Number-to-Text): Tất cả các chữ số, số đếm, năm, hoặc giá trị số xuất hiện trong văn bản gốc đều được hệ thống biên dịch tự động hoàn toàn sang dạng chữ viết thường tương ứng theo cách phát âm thuần Việt.
- Ví dụ: Số
20được chuẩn hóa thành chuỗi"hai mươi". - Ví dụ: Số
2026được chuẩn hóa thành chuỗi"hai nghìn không trăm hai mươi sáu".
🔄 3. Chiến Lược Gộp Và Phân Tách Dữ Liệu (Split & Shuffle Strategy)
Nhằm mục đích tạo ra một tập dữ liệu kiểm thử (Evaluation set) có tính tổng quát cao, khách quan và không bị lệch phân phối âm thanh, quy trình trích xuất phân đoạn được thực hiện theo 2 quy tắc:
- Đối với các bộ Dataset đã chia sẵn phân đoạn (Has existing split): Hệ thống sẽ gộp toàn bộ dữ liệu của hai phân đoạn `test` (kiểm thử) và `validation` (kiểm định) lại với nhau để tạo thành một tệp dữ liệu Ground Truth duy nhất có kích thước mẫu đủ lớn.
- Đối với các bộ Dataset không có phân đoạn sẵn (No split): Toàn bộ bảng dữ liệu gốc sẽ được xáo trộn ngẫu nhiên một cách đồng đều để loại bỏ tính tuần tự bằng thuật toán Shuffle với cấu hình cố định nhằm đảm bảo tính tái lập:
dataset.shuffle(seed=42, buffer_size=10000)