ThrishaSivasakthi/Tamil-Finetuning-data
Dataset Card for Dataset Name This dataset is designed for fine-tuning Large Language Models (LLMs) in Tamil, enabling them to understand and generate high-quality Tamil text across multiple domains. It contains 72,000 curated and generated samples, ensuring a rich linguistic diversity that improves model generalization. š¹ Sources: Kaggle Tamil NLP, Sentiment Analysis datasets, and synthetic data. š¹ Languages: Tamil, Tanglish (Tamil-English mix), and regional Tamil dialects.⦠See the full description on the dataset page: https://huggingface.co/datasets/ThrishaSivasakthi/Tamil-Finetuning-data.
011
Create README.md
Upload tamil_nlp_cleaned.csv
initial commit
