CoolFace
Datasetpublic

sreerag/svara-indic-curriculum-tokenized

svara-indic-curriculum-tokenized Malayalam + Hindi TTS dataset with text normalization (TN+TTS format), structured for curriculum learning. Stats Total: 3,430 records Malayalam: 1,754 samples Hindi: 1,676 samples Curriculum Difficulty Tier Count Categories 1 — Easy 1,025 Simple cardinals, clean prose 2 — Medium 1,445 Currency, units, ordinals, time 3 — Hard 960 Dates, phone numbers, mixed, complex Format Each… See the full description on the dataset page: https://huggingface.co/datasets/sreerag/svara-indic-curriculum-tokenized.

sourceHugging Faceupdated 5mo agoView on Hugging Face
0likes19downloads
settings

This repository belongs to sreerag on Hugging Face.

CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.

namesvara-indic-curriculum-tokenized
visibilitypublic
licencenot set
gatedno
ownersreerag
Account settings
sreerag/svara-indic-curriculum-tokenized · CoolFace