CoolFace
Datasetpublic

VietAudio-team/Vietnamese-asr-leaderboard

📊 Vietnamese Open ASR Evaluation Dataset Storage Kho lưu trữ dữ liệu nhãn bảo mật (Ground Truth) phục vụ cho hệ thống Vietnamese Open ASR Leaderboard. Toàn bộ dữ liệu được tổng hợp từ 9 bộ dữ liệu tiếng Việt công khai lớn nhất hiện nay, sau đó trải qua quy trình chuẩn hóa văn bản nghiêm ngặt để làm thước đo chuẩn mực đánh giá hiệu năng các mô hình nhận dạng giọng nói (ASR). [!TIP] 🚀 NỘP BÀI ĐÁNH GIÁ TẠI ĐÂY: 📈 1. Bảng Thống Kê Chi Tiết Hệ… See the full description on the dataset page: https://huggingface.co/datasets/VietAudio-team/Vietnamese-asr-leaderboard.

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
2likes136downloads
Dataset Card

📊 Vietnamese Open ASR Evaluation Dataset Storage

Kho lưu trữ dữ liệu nhãn bảo mật (Ground Truth) phục vụ cho hệ thống Vietnamese Open ASR Leaderboard. Toàn bộ dữ liệu được tổng hợp từ 9 bộ dữ liệu tiếng Việt công khai lớn nhất hiện nay, sau đó trải qua quy trình chuẩn hóa văn bản nghiêm ngặt để làm thước đo chuẩn mực đánh giá hiệu năng các mô hình nhận dạng giọng nói (ASR).

<br>

[!TIP] ### 🚀 NỘP BÀI ĐÁNH GIÁ TẠI ĐÂY: <a href="https://huggingface.co/spaces/VietAudio-team/Vietnamese-ASR-Leaderboard" target="_blank"> <img src="https://img.shields.io/badge/%F0%9F%A5%87%20Hugging%20Face-Submit%20to%20Leaderboard-8a2be2?style=for-the-badge&logo=huggingface&logoColor=white&color=2ea44f" alt="Submit to Leaderboard" height="40"> </a>

📈 1. Bảng Thống Kê Chi Tiết Hệ Dữ Liệu (Dataset Statistics)

Dưới đây là bảng tổng hợp chi tiết về số lượng hàng (mẫu âm thanh), tổng thời lượng ghi âm cấu thành và tần số lấy mẫu (Sampling Rate) nguyên bản của từng tập dữ liệu thành phần:

Tên DatasetSố dòng (Rows)Tổng thời lượngTần số gốc (Hz)Môi trường dữ liệu
vivos1,00001h 13m 48s16kHzSynthetic (Tổng hợp)
common_voice1,28101h 20m 40s32kHz, 44.1kHz, 48kHzSynthetic (Tổng hợp)
vivoice100,000114h 41m 17s24kHznatural (Đời thực)
vimd3,79920h 25m 16s32kHz, 44.1kHz, 48kHznatural (Đời thực)
lsvsc11,36420h 01m 44s16kHznatural (Đời thực)
vlsp11,28519h 06m 35s16kHznatural (Đời thực)
fosd5,18306h 56m 42s16kHz, 48kHznatural (Đời thực)
gigaspeech28,84417h 30m 16s16kHznatural (Đời thực)
bud50014,99910h 40m 18s16kHznatural (Đời thực)
TỔNG TOÀN BỘ157,755211h 56m 40sMulti-Hz (Đa dạng)Tổng hợp & Đời thực

🛠️ 2. Quy Trình Chuẩn Hóa Văn Bản (Text Normalization Pipeline)

Để đảm bảo tính nhất quán tối đa khi tính toán chỉ số lỗi từ (WER), toàn bộ phần văn bản đáp án gốc (transcription) trong kho lưu trữ này đã được xử lý tự động qua bộ tiền lọc chuẩn hóa cấu trúc ngôn ngữ:

  • —Chuẩn hóa ký tự & dấu câu: Giữ lại đầy đủ dấu tiếng Việt chuẩn, viết hoa các ký tự đầu câu/tên riêng theo ngữ cảnh gốc. Toàn bộ các ký tự đặc biệt rác bị loại bỏ, chỉ giữ lại 4 loại dấu câu cơ bản bao gồm: dấu phẩy (,), dấu chấm (.), dấu chấm hỏi (?), và dấu chấm than (!).
  • —Chuyển đổi số thành chữ (Number-to-Text): Tất cả các chữ số, số đếm, năm, hoặc giá trị số xuất hiện trong văn bản gốc đều được hệ thống biên dịch tự động hoàn toàn sang dạng chữ viết thường tương ứng theo cách phát âm thuần Việt.
  • —Ví dụ: Số 20 được chuẩn hóa thành chuỗi "hai mươi".
  • —Ví dụ: Số 2026 được chuẩn hóa thành chuỗi "hai nghìn không trăm hai mươi sáu".

🔄 3. Chiến Lược Gộp Và Phân Tách Dữ Liệu (Split & Shuffle Strategy)

Nhằm mục đích tạo ra một tập dữ liệu kiểm thử (Evaluation set) có tính tổng quát cao, khách quan và không bị lệch phân phối âm thanh, quy trình trích xuất phân đoạn được thực hiện theo 2 quy tắc:

  1. 1.Đối với các bộ Dataset đã chia sẵn phân đoạn (Has existing split): Hệ thống sẽ gộp toàn bộ dữ liệu của hai phân đoạn `test` (kiểm thử) và `validation` (kiểm định) lại với nhau để tạo thành một tệp dữ liệu Ground Truth duy nhất có kích thước mẫu đủ lớn.
  2. 2.Đối với các bộ Dataset không có phân đoạn sẵn (No split): Toàn bộ bảng dữ liệu gốc sẽ được xáo trộn ngẫu nhiên một cách đồng đều để loại bỏ tính tuần tự bằng thuật toán Shuffle với cấu hình cố định nhằm đảm bảo tính tái lập:
python
    dataset.shuffle(seed=42, buffer_size=10000)