datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
tanglish-tamil
Translation of Tanglish to tamil
Source: karky.in
To use
python import datasets s = datasets.load_dataset('Deepakvictor/tanglish-tamil') print(s) """DatasetDict({ train: Dataset({ features: ['Movie', 'FileName', 'Song', 'Tamillyrics', 'Tanglishlyrics', 'Mood', 'Genre'], num_rows: 597 }) })"""
Credits and Source: https://karky.in/
For simpler version
Visit this dataset --> "Deepakvictor/tan-tam"
tanglishmedbench
TanglishMedBench
Dataset Summary
TanglishMedBench is a gold-standard evaluation benchmark of 700 medical question-answer pairs in Tanglish — romanized, WhatsApp-style Tamil-English code-mixed text, as commonly typed by Tamil speakers in everyday messaging. The dataset is designed to evaluate how well language models handle medical queries posed in this informal, code-mixed register, which differs substantially from the formal Tamil or English text most models are… See the full description on the dataset page: https://huggingface.co/datasets/anthea1407/tanglishmedbench.data_for_English_2_TanglishTanglish-Conversational-SFTA synthetic Tanglish (Tamil-English code-switched) conversational dataset for instruction tuning and supervised fine-tuning.
tanglish-medical-triage-datatask_2_English_Tanglishtanglish-tamil
Translation of Tanglish to tamil
Source: karky.in
To use
python import datasets s = datasets.load_dataset('Deepakvictor/tanglish-tamil') print(s) """DatasetDict({ train: Dataset({ features: ['Movie', 'FileName', 'Song', 'Tamillyrics', 'Tanglishlyrics', 'Mood', 'Genre'], num_rows: 597 }) })"""
Credits and Source: https://karky.in/
For simpler version
Visit this dataset --> "Deepakvictor/tan-tam"
