CoolFace
Datasetpublic

Noothi/telugu-tech-custom-voice-v2

πŸŽ™οΈ Telugu Technical Custom Voice Dataset A high-quality, single-speaker Telugu tech speech dataset designed for fine-tuning text-to-speech (TTS) models like IndicF5-TTS, F5-TTS, XTTS v2, VITS, and ElevenLabs Voice Cloning. πŸ“Š Dataset Overview Total Clips: 676 WAV files Total Audio Duration: 70.61 minutes (1.18 hours / 4,236.54 seconds) Total Disk Size: 1.14 GB Average Clip Duration: 6.26 seconds (ranging 2.0s – 15.0s, optimal for TTS attention alignment) Audio… See the full description on the dataset page: https://huggingface.co/datasets/Noothi/telugu-tech-custom-voice-v2.

sourceHugging Facemitupdated 2mo agoView on Hugging Face
0likes62downloads
Dataset Card

πŸŽ™οΈ Telugu Technical Custom Voice Dataset

A high-quality, single-speaker Telugu tech speech dataset designed for fine-tuning text-to-speech (TTS) models like IndicF5-TTS, F5-TTS, XTTS v2, VITS, and ElevenLabs Voice Cloning.


πŸ“Š Dataset Overview

  • β€”Total Clips: 676 WAV files
  • β€”Total Audio Duration: 70.61 minutes (1.18 hours / 4,236.54 seconds)
  • β€”Total Disk Size: 1.14 GB
  • β€”Average Clip Duration: 6.26 seconds (ranging 2.0s – 15.0s, optimal for TTS attention alignment)
  • β€”Audio Format: 22,050 Hz / 48,000 Hz, 16-bit PCM Mono
  • β€”STT Transcription Engine: ElevenLabs Scribe V2 (scribe_v2)
  • β€”Train / Validation Split: 658 Train clips / 18 Validation clips

🎬 Video Source Breakdown

Video TitleWAV ClipsDurationDisk Size
Are we writing IF ELSE conditions properly ?171 clips17.80 mins293.52 MB
Production Backend Systems Part 1163 clips15.66 mins258.29 MB
Excel in software dev without CS degree149 clips17.68 mins291.58 MB
Why Netflix uses HTTP3 (Part 1)122 clips12.13 mins200.06 MB
How 1 thread handles 1M reqs (Node.js, Redis)72 clips7.35 mins121.18 MB
TOTAL DATASET676 clips70.61 mins1.14 GB

πŸ“ Files Structure

  • β€”wavs/: Isolated voice clips in .wav format.
  • β€”metadata.csv: Raw ElevenLabs Scribe V2 transcriptions (| delimited).
  • β€”metadata_clean.csv: Cleaned, NFC-normalized text with Code-Switched technical terms.
  • β€”metadata_telugu.csv: Pure Telugu script phonetic transliterations (, delimited).
  • β€”train.csv: Training split (658 clips).
  • β€”val.csv: Validation split (18 clips).

πŸš€ Usage with Hugging Face Datasets

python
from datasets import load_dataset

dataset = load_dataset("Noothi/telugu-tech-custom-voice-v2")
print(dataset)