CoolFace
Datasetpublic

nlpctx/tamil-english-corpus

Tamil-English Retrieval Corpus A high-quality multilingual retrieval corpus constructed from the Mozhi Tamil Corpus and machine-translated into English using IndicTrans2. Dataset Summary This dataset contains Tamil documents paired with English translations. The corpus was created by filtering high-quality documents from the Mozhi Tamil Corpus and translating them using AI4Bharat's IndicTrans2 translation model. The resulting corpus is intended to support:… See the full description on the dataset page: https://huggingface.co/datasets/nlpctx/tamil-english-corpus.

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes17downloads
discussions and pull requests

Conversations for this repository live on Hugging Face.

CoolFace shows imported repositories read-only. Posting into someone else’s repository from here would need an authorised integration and the account holder’s consent, so the link goes to the source instead.

Open discussions on Hugging Face
nlpctx/tamil-english-corpus · CoolFace