whyismydininghallonfire/orig-plus-asr-tamil-clean
orig-plus-asr-tamil-clean Combined ASR dataset built from: albagon/til26-asr-split (orig rows) whyismydininghallonfire/asr-tamil-clean (asr_tamil_clean rows) Audio paths are namespaced under each split to avoid filename collisions: audio/orig/... audio/asr_tamil_clean/... Each row keeps key, audio, transcript, and language, with an added source_dataset field. Counts: train: 3595 orig + 891 asr_tamil_clean = 4486 validation: 899 orig + 224 asr_tamil_clean = 1123
0233
orig-plus-asr-tamil-clean
Combined ASR dataset built from:
albagon/til26-asr-split(origrows)whyismydininghallonfire/asr-tamil-clean(asr_tamil_cleanrows)
Audio paths are namespaced under each split to avoid filename collisions:
audio/orig/...audio/asr_tamil_clean/...
Each row keeps key, audio, transcript, and language, with an added source_dataset field.
Counts:
- train: 3595 orig + 891 asrtamilclean = 4486
- validation: 899 orig + 224 asrtamilclean = 1123
