norbertm/whisper-eval-rare-languages-csv
Whisper 3 Large Evaluation on Mozilla Common Voice 17 Rare Languages (Enhanced Metrics) Dataset Description This enhanced dataset contains comprehensive evaluation results of OpenAI's Whisper 3 Large model on rare languages from Mozilla Common Voice 17, with extensive additional metrics for thorough ASR evaluation. Key Features Enhanced Error Metrics: WER (Word Error Rate): Standard word-level error measurement CER (Character Error Rate):… See the full description on the dataset page: https://huggingface.co/datasets/norbertm/whisper-eval-rare-languages-csv.
Whisper 3 Large Evaluation on Mozilla Common Voice 17 Rare Languages (Enhanced Metrics)
Dataset Description
This enhanced dataset contains comprehensive evaluation results of OpenAI's Whisper 3 Large model on rare languages from Mozilla Common Voice 17, with extensive additional metrics for thorough ASR evaluation.
Key Features
Enhanced Error Metrics:
- WER (Word Error Rate): Standard word-level error measurement
- CER (Character Error Rate): Character-level error measurement
- MER (Match Error Rate): Alternative error rate calculation
- WIL (Word Information Lost): Information loss measurement
Edit Distance Analysis:
- Word-level and character-level edit distances
- Normalized edit distance metrics
- Comprehensive distance analysis
Length and Structure Metrics:
- Word, character, and sentence counts
- Length ratios and differences
- Average word length analysis
- Sentence structure preservation
Script-Specific Analysis:
- Latin, Cyrillic, Armenian, Georgian, Tamil, Bengali character ratios
- Punctuation preservation analysis
- Script-specific performance metrics
Statistical Metrics:
- Jaccard similarity for vocabulary overlap
- Frequency correlation analysis
- Vocabulary union and overlap metrics
- Unique word analysis
Dataset Statistics
- Total samples: 111,507
- Languages: 21 rare languages
- Total metrics: 56 comprehensive evaluation metrics
- Scripts covered: Latin, Cyrillic, Armenian, Georgian, Tamil, Bengali
Language Coverage
Performance Highlights
Top Performing Languages (by WER):
- Hungarian (hu): WER = 0.1822
- Galician (gl): WER = 0.2027
- Slovenian (sl): WER = 0.2205
- Macedonian (mk): WER = 0.2762
- Latvian (lv): WER = 0.3021
Usage
from datasets import load_dataset
# Load the enhanced dataset
dataset = load_dataset("norbertm/whisper-eval-rare-languages-csv")
# Access comprehensive metrics
print(dataset['train'][0])Research Applications
This enhanced dataset enables:
- Comprehensive ASR Evaluation: Multiple error metrics for thorough analysis
- Script-Specific Analysis: Understanding performance across different writing systems
- Statistical Analysis: Vocabulary and frequency correlation studies
- Length Analysis: Understanding how text length affects recognition
- Cross-Language Comparison: Detailed performance comparison across 21 languages
Citation
If you use this dataset in your research, please cite:
@dataset{whisper_eval_enhanced_2024,
title={Whisper 3 Large Evaluation on Mozilla Common Voice 17 Rare Languages (Enhanced Metrics)},
author={norbertm},
year={2024},
publisher={Hugging Face},
url={https://huggingface.co/datasets/norbertm/whisper-eval-rare-languages-csv}
}License
This dataset is licensed under the MIT License.
This enhanced version includes 46 additional metrics beyond the original WER and CER, providing unprecedented depth for ASR evaluation research.
