ThrishaSivasakthi/Tamil-Finetuning-data
Dataset Card for Dataset Name This dataset is designed for fine-tuning Large Language Models (LLMs) in Tamil, enabling them to understand and generate high-quality Tamil text across multiple domains. It contains 72,000 curated and generated samples, ensuring a rich linguistic diversity that improves model generalization. ๐น Sources: Kaggle Tamil NLP, Sentiment Analysis datasets, and synthetic data. ๐น Languages: Tamil, Tanglish (Tamil-English mix), and regional Tamil dialects.โฆ See the full description on the dataset page: https://huggingface.co/datasets/ThrishaSivasakthi/Tamil-Finetuning-data.
Dataset Card for Dataset Name
This dataset is designed for fine-tuning Large Language Models (LLMs) in Tamil, enabling them to understand and generate high-quality Tamil text across multiple domains. It contains 72,000 curated and generated samples, ensuring a rich linguistic diversity that improves model generalization.
๐น Sources: Kaggle Tamil NLP, Sentiment Analysis datasets, and synthetic data. ๐น Languages: Tamil, Tanglish (Tamil-English mix), and regional Tamil dialects. ๐น Domains: Business, Casual, Sarcasm, Tanglish, Regional Tamil. ๐น Preprocessed: Cleaned, balanced, and formatted for optimal training.
Dataset Details
Dataset Description
The dataset is structured as follows:
Category Samples Description ๐ Kaggle Tamil NLP & Sentiment Data 30,000 Collected from existing Tamil datasets, labeled for sentiment analysis and general text understanding. ๐ค Generated Data (Multiple Domains) 45,000 AI-generated data to enhance domain-specific language understanding. ๐ผ Business Tamil ~10,000 Formal and professional language used in business settings. ๐ฃ๏ธ Casual Tamil ~10,000 Everyday conversational Tamil. ๐ญ Sarcasm & Humor ~8,000 Context-rich sarcastic and humorous dialogues. ๐ Regional Dialects ~7,000 Tamil variations spoken in different regions. ๐ Tanglish (Tamil-English Code-Mixing) ~10,000 Sentences combining Tamil and English.
Uses
๐ก Largest Tamil Dataset โ Covers multiple use cases and domains. ๐ก Fine-Tuned for LLMs โ Ideal for instruction-tuning and chatbots. ๐ก Supports Tanglish โ Unique dataset for code-mixed language models. ๐ก Preprocessed & Clean โ Ready to use for model training without extra cleaning.
