CoolFace
Datasetpublic

amithm3/shrutilipi

sourceHugging Faceapache-2.0updated 2y agoView on Hugging Face
6likes7.1kdownloads
README.md287 linesDownload Raw Back to root
1---2language:3- kn4- sa5- bn6- pa7- ml8- gu9- ta10- te11- hi12- mr13license: apache-2.014size_categories:15- 1M<n<10M16task_categories:17- automatic-speech-recognition18pretty_name: AI4Bharat Shrutilipi ASR Dataset19dataset_info:20- config_name: bn21  features:22  - name: audio23    dtype: audio24  - name: transcription25    dtype: string26  splits:27  - name: train28    num_bytes: 59658532357.72629    num_examples: 30234930  - name: validation31    num_bytes: 6723169844.1132    num_examples: 3760233  - name: test34    num_bytes: 7660623563.635    num_examples: 3874036  download_size: 7427869499437  dataset_size: 74042325765.43638- config_name: gu39  features:40  - name: audio41    dtype: audio42  - name: transcription43    dtype: string44  splits:45  - name: train46    num_bytes: 55793674372.62847    num_examples: 32993148  - name: validation49    num_bytes: 6293796356.18950    num_examples: 4077351  - name: test52    num_bytes: 7165218289.40853    num_examples: 4085354  download_size: 7834652370255  dataset_size: 69252689018.22556- config_name: hi57  features:58  - name: audio59    dtype: audio60  - name: transcription61    dtype: string62  splits:63  - name: train64    num_bytes: 213699256456.29665    num_examples: 87760466  - name: validation67    num_bytes: 27583551082.24868    num_examples: 11069269  - name: test70    num_bytes: 25110580660.23671    num_examples: 10849272  download_size: 26991293909273  dataset_size: 266393388198.7874- config_name: kn75  features:76  - name: audio77    dtype: audio78  - name: transcription79    dtype: string80  splits:81  - name: train82    num_bytes: 54770494386.87683    num_examples: 27876684  - name: validation85    num_bytes: 7864058142.9886    num_examples: 3472687  - name: test88    num_bytes: 7572538417.2889    num_examples: 3516690  download_size: 7425780930491  dataset_size: 70207090947.13692- config_name: ml93  features:94  - name: audio95    dtype: audio96  - name: transcription97    dtype: string98  splits:99  - name: train100    num_bytes: 71262913087.942101    num_examples: 467414102  - name: validation103    num_bytes: 7751159979.48104    num_examples: 58985105  - name: test106    num_bytes: 8930337765.4107    num_examples: 59230108  download_size: 99439381074109  dataset_size: 87944410832.82199110- config_name: mr111  features:112  - name: audio113    dtype: audio114  - name: transcription115    dtype: string116  splits:117  - name: train118    num_bytes: 125894833883.753119    num_examples: 505639120  - name: validation121    num_bytes: 14280421505.308122    num_examples: 63407123  - name: test124    num_bytes: 15230198579.815125    num_examples: 63397126  download_size: 147608513634127  dataset_size: 155405453968.876128- config_name: pa129  features:130  - name: audio131    dtype: audio132  - name: transcription133    dtype: string134  splits:135  - name: train136    num_bytes: 11549437955.164137    num_examples: 41874138  - name: validation139    num_bytes: 1317876276.359140    num_examples: 5311141  - name: test142    num_bytes: 1453641173.132143    num_examples: 5139144  download_size: 13966090670145  dataset_size: 14320955404.654999146- config_name: sa147  features:148  - name: audio149    dtype: audio150  - name: transcription151    dtype: string152  splits:153  - name: train154    num_bytes: 6219394271.104155    num_examples: 11532156  - name: validation157    num_bytes: 718650848.144158    num_examples: 1408159  - name: test160    num_bytes: 752806235.026161    num_examples: 1474162  download_size: 7321556791163  dataset_size: 7690851354.274164- config_name: ta165  features:166  - name: audio167    dtype: audio168  - name: transcription169    dtype: string170  splits:171  - name: train172    num_bytes: 101739123587.681173    num_examples: 429417174  - name: validation175    num_bytes: 12903430948.456176    num_examples: 54012177  - name: test178    num_bytes: 12724306851.984179    num_examples: 53827180  download_size: 126128595816181  dataset_size: 127366861388.12099182- config_name: te183  features:184  - name: audio185    dtype: audio186  - name: transcription187    dtype: string188  splits:189  - name: train190    num_bytes: 33158344172.292191    num_examples: 155322192  - name: validation193    num_bytes: 4085414503.579194    num_examples: 19501195  - name: test196    num_bytes: 4173443926.076197    num_examples: 19189198  download_size: 43278403108199  dataset_size: 41417202601.94701200configs:201- config_name: bn202  data_files:203  - split: train204    path: data/bn/train-*205  - split: validation206    path: data/bn/validation-*207  - split: test208    path: data/bn/test-*209- config_name: gu210  data_files:211  - split: train212    path: data/gu/train-*213  - split: validation214    path: data/gu/validation-*215  - split: test216    path: data/gu/test-*217- config_name: hi218  data_files:219  - split: train220    path: data/hi/train-*221  - split: validation222    path: data/hi/validation-*223  - split: test224    path: data/hi/test-*225- config_name: kn226  data_files:227  - split: train228    path: data/kn/train-*229  - split: validation230    path: data/kn/validation-*231  - split: test232    path: data/kn/test-*233- config_name: ml234  data_files:235  - split: train236    path: data/ml/train-*237  - split: validation238    path: data/ml/validation-*239  - split: test240    path: data/ml/test-*241- config_name: mr242  data_files:243  - split: train244    path: data/mr/train-*245  - split: validation246    path: data/mr/validation-*247  - split: test248    path: data/mr/test-*249- config_name: pa250  data_files:251  - split: train252    path: data/pa/train-*253  - split: validation254    path: data/pa/validation-*255  - split: test256    path: data/pa/test-*257- config_name: sa258  data_files:259  - split: train260    path: data/sa/train-*261  - split: validation262    path: data/sa/validation-*263  - split: test264    path: data/sa/test-*265- config_name: ta266  data_files:267  - split: train268    path: data/ta/train-*269  - split: validation270    path: data/ta/validation-*271  - split: test272    path: data/ta/test-*273- config_name: te274  data_files:275  - split: train276    path: data/te/train-*277  - split: validation278    path: data/te/validation-*279  - split: test280    path: data/te/test-*281tags:282- audio283- transcription284- AI4Bharat285- shrutilipi286---287