sarvamai/tatoeba-indic
Tatoeba Benchmark (Indian languages only) This benchmark is prepared from the 2023 Tatoeba Challenge, by extracting the dev and test sets for languages spoken in the Indian Republic. The code to download and process the data can be found here in the repo: data_prep/original_v1/extract.py Note: This is not the official version of Tatoeba benchmark. Just a processed mirror for Indian languages, made available in HuggingFace for ease of use. Languages Language… See the full description on the dataset page: https://huggingface.co/datasets/sarvamai/tatoeba-indic.
Update README.md
Add prep code
Delete 'nst' config (#2)
Add dev split for urd language
Add test split for urd language
Add test split for tel language
Add test split for tam language
Add test split for snd language
Add test split for sat language
Add test split for san language
Add test split for pli language
Add test split for pan language
Add test split for ori language
Add test split for nst language
Add test split for nep language
Add test split for mni language
Add dev split for mar language
Add test split for mar language
Add test split for mal language
Add test split for mai language
Add test split for lah language
Add test split for kok language
Add dev split for kha language
Add test split for kha language
Add dev split for kan language
Add test split for kan language
Add dev split for hin language
Add test split for hin language
Add test split for guj language
Add test split for brx language
Add test split for bho language
Add dev split for ben language
Add test split for ben language
Add test split for awa language
Add dev split for asm language
Add test split for asm language
initial commit
