CoolFace
Datasetpublic

ThrishaSivasakthi/Tamil-Finetuning-data

Dataset Card for Dataset Name This dataset is designed for fine-tuning Large Language Models (LLMs) in Tamil, enabling them to understand and generate high-quality Tamil text across multiple domains. It contains 72,000 curated and generated samples, ensuring a rich linguistic diversity that improves model generalization. ๐Ÿ”น Sources: Kaggle Tamil NLP, Sentiment Analysis datasets, and synthetic data. ๐Ÿ”น Languages: Tamil, Tanglish (Tamil-English mix), and regional Tamil dialects.โ€ฆ See the full description on the dataset page: https://huggingface.co/datasets/ThrishaSivasakthi/Tamil-Finetuning-data.

sourceHugging Faceupdated 2y agoView on Hugging Face
0likes11downloads
Dataset Card

Dataset Card for Dataset Name

This dataset is designed for fine-tuning Large Language Models (LLMs) in Tamil, enabling them to understand and generate high-quality Tamil text across multiple domains. It contains 72,000 curated and generated samples, ensuring a rich linguistic diversity that improves model generalization.

๐Ÿ”น Sources: Kaggle Tamil NLP, Sentiment Analysis datasets, and synthetic data. ๐Ÿ”น Languages: Tamil, Tanglish (Tamil-English mix), and regional Tamil dialects. ๐Ÿ”น Domains: Business, Casual, Sarcasm, Tanglish, Regional Tamil. ๐Ÿ”น Preprocessed: Cleaned, balanced, and formatted for optimal training.

Dataset Details

Dataset Description

The dataset is structured as follows:

Category Samples Description ๐Ÿ“š Kaggle Tamil NLP & Sentiment Data 30,000 Collected from existing Tamil datasets, labeled for sentiment analysis and general text understanding. ๐Ÿค– Generated Data (Multiple Domains) 45,000 AI-generated data to enhance domain-specific language understanding. ๐Ÿ’ผ Business Tamil ~10,000 Formal and professional language used in business settings. ๐Ÿ—ฃ๏ธ Casual Tamil ~10,000 Everyday conversational Tamil. ๐ŸŽญ Sarcasm & Humor ~8,000 Context-rich sarcastic and humorous dialogues. ๐Ÿ  Regional Dialects ~7,000 Tamil variations spoken in different regions. ๐ŸŒ Tanglish (Tamil-English Code-Mixing) ~10,000 Sentences combining Tamil and English.

Uses

๐Ÿ’ก Largest Tamil Dataset โ€“ Covers multiple use cases and domains. ๐Ÿ’ก Fine-Tuned for LLMs โ€“ Ideal for instruction-tuning and chatbots. ๐Ÿ’ก Supports Tanglish โ€“ Unique dataset for code-mixed language models. ๐Ÿ’ก Preprocessed & Clean โ€“ Ready to use for model training without extra cleaning.