sulabhkatiyar/ne-asr-dataset-lus-aug
NE ASR Augmented Dataset -- Mizo (lus) Augmented automatic speech recognition dataset for Mizo (lus), a Tibeto-Burman language spoken in Mizoram, India. Source Augmented from sulabhkatiyar/ne-asr-lus (original transcribed speech data from the ARTPARK-IISc Vaani project). Language Information Property Value Language Mizo ISO 639-3 lus Family Tibeto-Burman Region Mizoram, India Tonal Yes Tier D (20.75h original data)… See the full description on the dataset page: https://huggingface.co/datasets/sulabhkatiyar/ne-asr-dataset-lus-aug.
NE ASR Augmented Dataset -- Mizo (lus)
Augmented automatic speech recognition dataset for Mizo (lus), a Tibeto-Burman language spoken in Mizoram, India.
Source
Augmented from `sulabhkatiyar/ne-asr-lus` (original transcribed speech data from the ARTPARK-IISc Vaani project).
Language Information
Dataset Statistics
- Original training samples: 9,850
- Augmented training samples: 29,550 (3x augmentation)
- Train shards: 50
- Estimated original duration: ~20.8 hours
- Estimated augmented duration: ~62.2 hours
Transformations Applied
Each original training sample produces 3 samples (1 original + 2 speed + 0 pitch):
- Speed perturbation: 0.9x, 1.1x (2 variants per sample)
- Pitch shift: Disabled (tonal language -- pitch shift would alter lexical meaning)
- Noise augmentation: Not applied
SpecAugment Parameters (for training, NOT in this dataset)
These parameters are consumed by the training script and are not baked into the audio files:
mask_time_prob: 0.1mask_time_length: 10mask_feature_prob: 0.05mask_feature_length: 10layerdrop: 0.05
Full augmentation config: `configs/augmentation_config.yaml`
Dataset Format
- Audio: 16kHz mono WAV (stored as Parquet with audio bytes)
- Text: Transcriptions
- Features:
audio,text,language,augmentation - Augmentation labels:
original,speed_0.9,speed_1.1
How to Use
from datasets import load_dataset
# Load the full dataset
ds = load_dataset("sulabhkatiyar/ne-asr-lus-aug")
# Load only the training split
train = load_dataset("sulabhkatiyar/ne-asr-lus-aug", split="train")
# Filter to only original (non-augmented) samples
original_only = train.filter(lambda x: x["augmentation"] == "original")
# Filter to a specific augmentation type
speed_09 = train.filter(lambda x: x["augmentation"] == "speed_0.9")Original Data
- Source dataset: `sulabhkatiyar/ne-asr-lus`
- Project: ARTPARK-IISc Vaani
- License: CC-BY-4.0
Citation
If you use this dataset, please cite the Vaani project and acknowledge the augmentation pipeline.
