sajilck/malayalam-asr-corpus
Malayalam ASR Corpus A multi-corpus Malayalam speech dataset aggregated from 5 public sources, created for fine-tuning ASR models on Malayalam language. This dataset was used to train sajilck/whisper-small-malayalam — the first multi-corpus Malayalam Whisper model on HuggingFace, achieving 37.64% WER on CommonVoice 25 Malayalam test set. Source Corpora Corpus Domain Speaker Type License IMaSC TTS / Read speech Studio speakers CC BY 4.0 SMC Malayalam… See the full description on the dataset page: https://huggingface.co/datasets/sajilck/malayalam-asr-corpus.
Malayalam ASR Corpus
A multi-corpus Malayalam speech dataset aggregated from 5 public sources, created for fine-tuning ASR models on Malayalam language.
This dataset was used to train sajilck/whisper-small-malayalam — the first multi-corpus Malayalam Whisper model on HuggingFace, achieving 37.64% WER on CommonVoice 25 Malayalam test set.
Dataset Description
- Total samples: ~86,000
- Total size: 17.1 GB
- Language: Malayalam (ml)
- Task: Automatic Speech Recognition
- Splits: train / validation / test
Source Corpora
Dataset Structure
Each split contains the following columns:
Data Collection and Processing
Audio from all 5 corpora was preprocessed as follows:
- Resampled to 16kHz mono
- Filtered to 0.5–30 second clips
- Source tagged for corpus-level analysis
- Split into train / validation / test sets (90% / 5% / 5%)
Usage
from datasets import load_dataset
dataset = load_dataset("sajilck/malayalam-asr-corpus")
print(dataset)
# DatasetDict({
# train: Dataset({features: ['audio', 'sentence', 'source', 'duration_s']}),
# validation: Dataset({...}),
# test: Dataset({...})
# })
# Access a sample
sample = dataset["train"][0]
print(sample["sentence"]) # Malayalam transcript
print(sample["source"]) # e.g. "commonvoice", "imasc", "smc"
print(sample["duration_s"]) # e.g. 4.32Model Trained on This Dataset
sajilck/whisper-small-malayalam
Citation
@misc{sajilck2026malayalamasrcorpus,
author = {Sajil C.K.},
title = {Malayalam ASR Corpus: A Multi-Source Malayalam Speech Dataset},
year = {2026},
publisher = {HuggingFace},
url = {https://huggingface.co/datasets/sajilck/malayalam-asr-corpus}
}License
This dataset is released under CC BY 4.0. Individual source corpora retain their original licenses — please refer to each source for specific terms.
