amithm3/shrutilipi
67.1k
1---2language:3- kn4- sa5- bn6- pa7- ml8- gu9- ta10- te11- hi12- mr13license: apache-2.014size_categories:15- 1M<n<10M16task_categories:17- automatic-speech-recognition18pretty_name: AI4Bharat Shrutilipi ASR Dataset19dataset_info:20- config_name: bn21 features:22 - name: audio23 dtype: audio24 - name: transcription25 dtype: string26 splits:27 - name: train28 num_bytes: 59658532357.72629 num_examples: 30234930 - name: validation31 num_bytes: 6723169844.1132 num_examples: 3760233 - name: test34 num_bytes: 7660623563.635 num_examples: 3874036 download_size: 7427869499437 dataset_size: 74042325765.43638- config_name: gu39 features:40 - name: audio41 dtype: audio42 - name: transcription43 dtype: string44 splits:45 - name: train46 num_bytes: 55793674372.62847 num_examples: 32993148 - name: validation49 num_bytes: 6293796356.18950 num_examples: 4077351 - name: test52 num_bytes: 7165218289.40853 num_examples: 4085354 download_size: 7834652370255 dataset_size: 69252689018.22556- config_name: hi57 features:58 - name: audio59 dtype: audio60 - name: transcription61 dtype: string62 splits:63 - name: train64 num_bytes: 213699256456.29665 num_examples: 87760466 - name: validation67 num_bytes: 27583551082.24868 num_examples: 11069269 - name: test70 num_bytes: 25110580660.23671 num_examples: 10849272 download_size: 26991293909273 dataset_size: 266393388198.7874- config_name: kn75 features:76 - name: audio77 dtype: audio78 - name: transcription79 dtype: string80 splits:81 - name: train82 num_bytes: 54770494386.87683 num_examples: 27876684 - name: validation85 num_bytes: 7864058142.9886 num_examples: 3472687 - name: test88 num_bytes: 7572538417.2889 num_examples: 3516690 download_size: 7425780930491 dataset_size: 70207090947.13692- config_name: ml93 features:94 - name: audio95 dtype: audio96 - name: transcription97 dtype: string98 splits:99 - name: train100 num_bytes: 71262913087.942101 num_examples: 467414102 - name: validation103 num_bytes: 7751159979.48104 num_examples: 58985105 - name: test106 num_bytes: 8930337765.4107 num_examples: 59230108 download_size: 99439381074109 dataset_size: 87944410832.82199110- config_name: mr111 features:112 - name: audio113 dtype: audio114 - name: transcription115 dtype: string116 splits:117 - name: train118 num_bytes: 125894833883.753119 num_examples: 505639120 - name: validation121 num_bytes: 14280421505.308122 num_examples: 63407123 - name: test124 num_bytes: 15230198579.815125 num_examples: 63397126 download_size: 147608513634127 dataset_size: 155405453968.876128- config_name: pa129 features:130 - name: audio131 dtype: audio132 - name: transcription133 dtype: string134 splits:135 - name: train136 num_bytes: 11549437955.164137 num_examples: 41874138 - name: validation139 num_bytes: 1317876276.359140 num_examples: 5311141 - name: test142 num_bytes: 1453641173.132143 num_examples: 5139144 download_size: 13966090670145 dataset_size: 14320955404.654999146- config_name: sa147 features:148 - name: audio149 dtype: audio150 - name: transcription151 dtype: string152 splits:153 - name: train154 num_bytes: 6219394271.104155 num_examples: 11532156 - name: validation157 num_bytes: 718650848.144158 num_examples: 1408159 - name: test160 num_bytes: 752806235.026161 num_examples: 1474162 download_size: 7321556791163 dataset_size: 7690851354.274164- config_name: ta165 features:166 - name: audio167 dtype: audio168 - name: transcription169 dtype: string170 splits:171 - name: train172 num_bytes: 101739123587.681173 num_examples: 429417174 - name: validation175 num_bytes: 12903430948.456176 num_examples: 54012177 - name: test178 num_bytes: 12724306851.984179 num_examples: 53827180 download_size: 126128595816181 dataset_size: 127366861388.12099182- config_name: te183 features:184 - name: audio185 dtype: audio186 - name: transcription187 dtype: string188 splits:189 - name: train190 num_bytes: 33158344172.292191 num_examples: 155322192 - name: validation193 num_bytes: 4085414503.579194 num_examples: 19501195 - name: test196 num_bytes: 4173443926.076197 num_examples: 19189198 download_size: 43278403108199 dataset_size: 41417202601.94701200configs:201- config_name: bn202 data_files:203 - split: train204 path: data/bn/train-*205 - split: validation206 path: data/bn/validation-*207 - split: test208 path: data/bn/test-*209- config_name: gu210 data_files:211 - split: train212 path: data/gu/train-*213 - split: validation214 path: data/gu/validation-*215 - split: test216 path: data/gu/test-*217- config_name: hi218 data_files:219 - split: train220 path: data/hi/train-*221 - split: validation222 path: data/hi/validation-*223 - split: test224 path: data/hi/test-*225- config_name: kn226 data_files:227 - split: train228 path: data/kn/train-*229 - split: validation230 path: data/kn/validation-*231 - split: test232 path: data/kn/test-*233- config_name: ml234 data_files:235 - split: train236 path: data/ml/train-*237 - split: validation238 path: data/ml/validation-*239 - split: test240 path: data/ml/test-*241- config_name: mr242 data_files:243 - split: train244 path: data/mr/train-*245 - split: validation246 path: data/mr/validation-*247 - split: test248 path: data/mr/test-*249- config_name: pa250 data_files:251 - split: train252 path: data/pa/train-*253 - split: validation254 path: data/pa/validation-*255 - split: test256 path: data/pa/test-*257- config_name: sa258 data_files:259 - split: train260 path: data/sa/train-*261 - split: validation262 path: data/sa/validation-*263 - split: test264 path: data/sa/test-*265- config_name: ta266 data_files:267 - split: train268 path: data/ta/train-*269 - split: validation270 path: data/ta/validation-*271 - split: test272 path: data/ta/test-*273- config_name: te274 data_files:275 - split: train276 path: data/te/train-*277 - split: validation278 path: data/te/validation-*279 - split: test280 path: data/te/test-*281tags:282- audio283- transcription284- AI4Bharat285- shrutilipi286---287 