CoolFace
Datasetpublic

whyismydininghallonfire/orig-plus-asr-tamil-clean

orig-plus-asr-tamil-clean Combined ASR dataset built from: albagon/til26-asr-split (orig rows) whyismydininghallonfire/asr-tamil-clean (asr_tamil_clean rows) Audio paths are namespaced under each split to avoid filename collisions: audio/orig/... audio/asr_tamil_clean/... Each row keeps key, audio, transcript, and language, with an added source_dataset field. Counts: train: 3595 orig + 891 asr_tamil_clean = 4486 validation: 899 orig + 224 asr_tamil_clean = 1123

sourceHugging Faceupdated 4mo agoView on Hugging Face
0likes233downloads
Dataset Card

orig-plus-asr-tamil-clean

Combined ASR dataset built from:

  • —albagon/til26-asr-split (orig rows)
  • —whyismydininghallonfire/asr-tamil-clean (asr_tamil_clean rows)

Audio paths are namespaced under each split to avoid filename collisions:

  • —audio/orig/...
  • —audio/asr_tamil_clean/...

Each row keeps key, audio, transcript, and language, with an added source_dataset field.

Counts:

  • —train: 3595 orig + 891 asrtamilclean = 4486
  • —validation: 899 orig + 224 asrtamilclean = 1123