CoolFace
Datasetpublic

nlpctx/tamil-english-corpus

Tamil-English Retrieval Corpus A high-quality multilingual retrieval corpus constructed from the Mozhi Tamil Corpus and machine-translated into English using IndicTrans2. Dataset Summary This dataset contains Tamil documents paired with English translations. The corpus was created by filtering high-quality documents from the Mozhi Tamil Corpus and translating them using AI4Bharat's IndicTrans2 translation model. The resulting corpus is intended to support:… See the full description on the dataset page: https://huggingface.co/datasets/nlpctx/tamil-english-corpus.

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes17downloads

nlpctx/tamil-english-corpus · main · files are served by the source, never re-hosted here