CoolFace
Datasetpublic

sajilck/malayalam-asr-corpus

Malayalam ASR Corpus A multi-corpus Malayalam speech dataset aggregated from 5 public sources, created for fine-tuning ASR models on Malayalam language. This dataset was used to train sajilck/whisper-small-malayalam — the first multi-corpus Malayalam Whisper model on HuggingFace, achieving 37.64% WER on CommonVoice 25 Malayalam test set. Source Corpora Corpus Domain Speaker Type License IMaSC TTS / Read speech Studio speakers CC BY 4.0 SMC Malayalam… See the full description on the dataset page: https://huggingface.co/datasets/sajilck/malayalam-asr-corpus.

sourceHugging Facecc-by-4.0updated 2mo agoView on Hugging Face
0likes313downloads
Dataset Card

Malayalam ASR Corpus

A multi-corpus Malayalam speech dataset aggregated from 5 public sources, created for fine-tuning ASR models on Malayalam language.

This dataset was used to train sajilck/whisper-small-malayalam — the first multi-corpus Malayalam Whisper model on HuggingFace, achieving 37.64% WER on CommonVoice 25 Malayalam test set.

Dataset Description

  • Total samples: ~86,000
  • Total size: 17.1 GB
  • Language: Malayalam (ml)
  • Task: Automatic Speech Recognition
  • Splits: train / validation / test

Source Corpora

CorpusDomainSpeaker TypeLicense
IMaSCTTS / Read speechStudio speakersCC BY 4.0
SMC Malayalam Speech CorpusRead speechCrowdsourcedCC BY 4.0
IndicTTS MalayalamTTS / Read speechProfessional speakersCC BY 4.0
OpenSLR 63CrowdsourcedMultiple speakersCC BY-SA 4.0
CommonVoice 25 MalayalamCrowdsourcedMultiple speakersCC0

Dataset Structure

Each split contains the following columns:

ColumnTypeDescription
audioAudioRaw audio at 16kHz mono
sentencestringMalayalam transcript
sourcestringSource corpus name
duration_sfloatAudio clip duration in seconds

Data Collection and Processing

Audio from all 5 corpora was preprocessed as follows:

  • Resampled to 16kHz mono
  • Filtered to 0.5–30 second clips
  • Source tagged for corpus-level analysis
  • Split into train / validation / test sets (90% / 5% / 5%)

Usage

python
from datasets import load_dataset

dataset = load_dataset("sajilck/malayalam-asr-corpus")

print(dataset)
# DatasetDict({
#     train: Dataset({features: ['audio', 'sentence', 'source', 'duration_s']}),
#     validation: Dataset({...}),
#     test: Dataset({...})
# })

# Access a sample
sample = dataset["train"][0]
print(sample["sentence"])   # Malayalam transcript
print(sample["source"])     # e.g. "commonvoice", "imasc", "smc"
print(sample["duration_s"]) # e.g. 4.32

Model Trained on This Dataset

sajilck/whisper-small-malayalam

ModelParamsWER ↓
openai/whisper-small (base)244M~85%
smcproject/Malwhisper-v1-medium769M61.84%
sajilck/whisper-small-malayalam244M37.64%

Citation

bibtex
@misc{sajilck2026malayalamasrcorpus,
  author    = {Sajil C.K.},
  title     = {Malayalam ASR Corpus: A Multi-Source Malayalam Speech Dataset},
  year      = {2026},
  publisher = {HuggingFace},
  url       = {https://huggingface.co/datasets/sajilck/malayalam-asr-corpus}
}

License

This dataset is released under CC BY 4.0. Individual source corpora retain their original licenses — please refer to each source for specific terms.