nameissakthi/hindi-english-bilingual
Hindi/English/Hinglish Bilingual TTS Dataset Synthetic TTS dataset generated by Rani voice (ai4bharat/indic-parler-tts) for training a lightweight bilingual student TTS model. Designed for natural-sounding Hindi, English, and Hinglish (code-switched) speech synthesis. Dataset Summary Property Value Total utterances 23,277 Total audio ~4.7GB (24kHz WAV) Languages Hindi (hi), English (en), Hinglish (bi) Sample rate 24kHz Voice Rani —… See the full description on the dataset page: https://huggingface.co/datasets/nameissakthi/hindi-english-bilingual.
Hindi/English/Hinglish Bilingual TTS Dataset
Synthetic TTS dataset generated by Rani voice (ai4bharat/indic-parler-tts) for training a lightweight bilingual student TTS model.
Designed for natural-sounding Hindi, English, and Hinglish (code-switched) speech synthesis.
Dataset Summary
Splits
Files
data/
├── features.json # All linguistic features for 26,397 entries
└── mel_stats.json # Per-bin mel mean/std (80 bins, 11.2M frames)
wavs/
└── *.wav # 26,578 teacher audio files at 24kHzfeatures.json Format
{
"vocab": {"<pad>": 0, "<bos>": 1, "<eos>": 2, "SIL": 3, ...},
"pitch_mean": 5.3579,
"pitch_std": 0.8234,
"energy_mean": 1.2341,
"energy_std": 0.4512,
"entries": [
{
"id": "hi_001",
"text": "नमस्ते",
"lid": 0,
"phone_ids": [1, 12, 4, 15, ...],
"durations": [4, 6, 3, 5, ...],
"pitch": [5.12, 5.34, 0.0, ...],
"energy": [1.2, 1.4, 0.8, ...]
}
]
}LID: 0 = Hindi / Hinglish, 1 = English only
Mel Configuration
sample_rate=24000, hop_length=256, win_length=1024, n_fft=1024
n_mels=80, f_min=0, f_max=8000, norm=slaney, power=1.0
mel = log(clamp(mel_spectrogram, 1e-5))mel_stats.json
Per-bin normalization stats computed from all 26,578 mel files:
mel_mean: list of 80 floats, range [-7.50, -2.23]mel_std: list of 80 floats, range [1.18, 2.55]n_frames: 11,208,464n_files: 26,578
Used to normalize mel targets during training: (mel - mean) / std
Usage
from datasets import load_dataset
ds = load_dataset("nameissakthi/hindi-english-bilingual")Or load features manually:
import json
features = json.load(open("data/features.json"))
vocab = features["vocab"]
entries = features["entries"] # list of 26,397 dicts
entry = entries[0]
# entry["id"], entry["lid"], entry["phone_ids"],
# entry["durations"], entry["pitch"], entry["energy"]Student Model
Trained on this dataset: hindi-bilingual-tts on GitHub
~21M param bilingual TTS student distilled from Rani voice.
License
Released under CC BY 4.0.
