CoolFace
Datasetpublic

nameissakthi/hindi-english-bilingual

Hindi/English/Hinglish Bilingual TTS Dataset Synthetic TTS dataset generated by Rani voice (ai4bharat/indic-parler-tts) for training a lightweight bilingual student TTS model. Designed for natural-sounding Hindi, English, and Hinglish (code-switched) speech synthesis. Dataset Summary Property Value Total utterances 23,277 Total audio ~4.7GB (24kHz WAV) Languages Hindi (hi), English (en), Hinglish (bi) Sample rate 24kHz Voice Rani —… See the full description on the dataset page: https://huggingface.co/datasets/nameissakthi/hindi-english-bilingual.

sourceHugging Facecc-by-4.0updated 6mo agoView on Hugging Face
0likes258downloads
Dataset Card

Hindi/English/Hinglish Bilingual TTS Dataset

Synthetic TTS dataset generated by Rani voice (ai4bharat/indic-parler-tts) for training a lightweight bilingual student TTS model.

Designed for natural-sounding Hindi, English, and Hinglish (code-switched) speech synthesis.


Dataset Summary

PropertyValue
Total utterances23,277
Total audio~4.7GB (24kHz WAV)
LanguagesHindi (hi), English (en), Hinglish (bi)
Sample rate24kHz
VoiceRani — ai4bharat/indic-parler-tts
AlignmentMFA 3.x with custom Hindi acoustic model

Splits

SplitCountContent
Hindi (hi)6,732Formal Hindi sentences from IndicTTS
English (en)6,451English sentences
Hinglish (bi)10,094Code-switched Hindi/English — conversational, mixed

Files

data/
├── features.json       # All linguistic features for 26,397 entries
└── mel_stats.json      # Per-bin mel mean/std (80 bins, 11.2M frames)
wavs/
└── *.wav               # 26,578 teacher audio files at 24kHz

features.json Format

json
{
  "vocab": {"<pad>": 0, "<bos>": 1, "<eos>": 2, "SIL": 3, ...},
  "pitch_mean": 5.3579,
  "pitch_std": 0.8234,
  "energy_mean": 1.2341,
  "energy_std": 0.4512,
  "entries": [
    {
      "id": "hi_001",
      "text": "नमस्ते",
      "lid": 0,
      "phone_ids": [1, 12, 4, 15, ...],
      "durations": [4, 6, 3, 5, ...],
      "pitch": [5.12, 5.34, 0.0, ...],
      "energy": [1.2, 1.4, 0.8, ...]
    }
  ]
}

LID: 0 = Hindi / Hinglish, 1 = English only


Mel Configuration

sample_rate=24000, hop_length=256, win_length=1024, n_fft=1024
n_mels=80, f_min=0, f_max=8000, norm=slaney, power=1.0
mel = log(clamp(mel_spectrogram, 1e-5))

mel_stats.json

Per-bin normalization stats computed from all 26,578 mel files:

  • —mel_mean: list of 80 floats, range [-7.50, -2.23]
  • —mel_std: list of 80 floats, range [1.18, 2.55]
  • —n_frames: 11,208,464
  • —n_files: 26,578

Used to normalize mel targets during training: (mel - mean) / std


Usage

python
from datasets import load_dataset

ds = load_dataset("nameissakthi/hindi-english-bilingual")

Or load features manually:

python
import json

features = json.load(open("data/features.json"))
vocab = features["vocab"]
entries = features["entries"]  # list of 26,397 dicts

entry = entries[0]
# entry["id"], entry["lid"], entry["phone_ids"],
# entry["durations"], entry["pitch"], entry["energy"]

Student Model

Trained on this dataset: hindi-bilingual-tts on GitHub

~21M param bilingual TTS student distilled from Rani voice.


License

Released under CC BY 4.0.

nameissakthi/hindi-english-bilingual · CoolFace