datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
Indian-Multilingual-Bias-Dataset
Indian Multilingual Bias Dataset
Dataset Description
The Indian Multilingual Bias Dataset is a comprehensive collection designed to evaluate and measure social biases in Large Language Models (LLMs) across three major Indian languages: English, Bengali (বাংলা), and Hindi (हिंदी). This dataset is based on the original Indian-BhED dataset and focuses on four critical dimensions of bias prevalent in Indian society.
Key Features
🌐 Multilingual:… See the full description on the dataset page: https://huggingface.co/datasets/Debk/Indian-Multilingual-Bias-Dataset.Indian_Cyber_Scam_PhoneCall_Hinglish_Dataset
Indian Scam Communication Dataset
Overview
The Indian Scam Communication Dataset is a curated collection of scam-related messages, call transcripts, and fraud communication patterns commonly observed in India.
The dataset is designed for researchers, students, cybersecurity professionals, NLP engineers, and law-enforcement technology developers working on scam detection, fraud prevention, and conversational AI safety.
Motivation
India has witnessed… See the full description on the dataset page: https://huggingface.co/datasets/ysangam/Indian_Cyber_Scam_PhoneCall_Hinglish_Dataset.flipkart-data-indianindian-pharma-dataIndian_Cyber_Scam_PhoneCall_Hinglish_Dataset
Indian Scam Communication Dataset
Overview
The Indian Scam Communication Dataset is a curated collection of scam-related messages, call transcripts, and fraud communication patterns commonly observed in India.
The dataset is designed for researchers, students, cybersecurity professionals, NLP engineers, and law-enforcement technology developers working on scam detection, fraud prevention, and conversational AI safety.
Motivation
India has witnessed… See the full description on the dataset page: https://huggingface.co/datasets/DatasetNewUser/Indian_Cyber_Scam_PhoneCall_Hinglish_Dataset.indian-recipe-datasetIndian_Names_with_Gender_Dataset
🇮🇳 Indian Names & Gender Dataset (Balanced)
Dataset Summary
This dataset contains 42,000 samples designed for training models to identify Indian names and classify their gender. It is perfectly balanced across three categories, making it ideal for training robust classifiers that can distinguish between real names and random text.
Dataset Structure
Column
Type
Description
Name
String
The text string (Name or Random Word).
Label
Integer
Class ID… See the full description on the dataset page: https://huggingface.co/datasets/shisha-07/Indian_Names_with_Gender_Dataset.Indian_Cyber_Scam_PhoneCall_Hinglish_Dataset
Indian Scam Communication Dataset
Overview
The Indian Scam Communication Dataset is a curated collection of scam-related messages, call transcripts, and fraud communication patterns commonly observed in India.
The dataset is designed for researchers, students, cybersecurity professionals, NLP engineers, and law-enforcement technology developers working on scam detection, fraud prevention, and conversational AI safety.
Motivation
India has witnessed… See the full description on the dataset page: https://huggingface.co/datasets/harshlimkar/Indian_Cyber_Scam_PhoneCall_Hinglish_Dataset.Indian_Cyber_Scam_PhoneCall_Hinglish_Dataset
Indian Scam Communication Dataset
Overview
The Indian Scam Communication Dataset is a curated collection of scam-related messages, call transcripts, and fraud communication patterns commonly observed in India.
The dataset is designed for researchers, students, cybersecurity professionals, NLP engineers, and law-enforcement technology developers working on scam detection, fraud prevention, and conversational AI safety.
Motivation
India has witnessed… See the full description on the dataset page: https://huggingface.co/datasets/arka15/Indian_Cyber_Scam_PhoneCall_Hinglish_Dataset.Indian_Cyber_Scam_PhoneCall_Hinglish_Dataset
Indian Scam Communication Dataset
Overview
The Indian Scam Communication Dataset is a curated collection of scam-related messages, call transcripts, and fraud communication patterns commonly observed in India.
The dataset is designed for researchers, students, cybersecurity professionals, NLP engineers, and law-enforcement technology developers working on scam detection, fraud prevention, and conversational AI safety.
Motivation
India has witnessed… See the full description on the dataset page: https://huggingface.co/datasets/szjkdsldf/Indian_Cyber_Scam_PhoneCall_Hinglish_Dataset.Indian_Cyber_Scam_PhoneCall_Hinglish_Dataset
Indian Scam Communication Dataset
Overview
The Indian Scam Communication Dataset is a curated collection of scam-related messages, call transcripts, and fraud communication patterns commonly observed in India.
The dataset is designed for researchers, students, cybersecurity professionals, NLP engineers, and law-enforcement technology developers working on scam detection, fraud prevention, and conversational AI safety.
Motivation
India has witnessed… See the full description on the dataset page: https://huggingface.co/datasets/chinna887/Indian_Cyber_Scam_PhoneCall_Hinglish_Dataset.indian-family-law-data
Indian Family Law QA Dataset
This dataset contains 1,401 high-quality question-answer pairs focused on Family Law II, specifically tailored for legal studies in the Indian context. The dataset covers critical areas such as Hindu Succession, Coparcenary rights, and principles of Muslim Law.
Dataset Details
Total Rows: 1,401
Language: English
Task: Question Answering / Legal Knowledge Retrieval
Format: CSV (two-column format)
Dataset Structure
The dataset is… See the full description on the dataset page: https://huggingface.co/datasets/steamed-potatop/indian-family-law-data.Indian_Multilingual_Scam_Message_Dataset
Indian Multilingual Scam Message Dataset
Overview
This dataset contains 120 realistic SMS and text messages from Indian contexts, labeled as scam or legitimate. It reflects real-world communication patterns across Hindi, Hinglish, and English.
Features
120 high-quality samples
Multilingual (Hindi, Hinglish, English)
Real-world inspired scam and legitimate messages
Includes reasoning for each label
Covers multiple domains: banking, ecommerce, telecom, utilities… See the full description on the dataset page: https://huggingface.co/datasets/karanverma19/Indian_Multilingual_Scam_Message_Dataset.Multilingual_Customer_Support_Intent_Dataset_for_Indian_Contexts
Multilingual Customer Support Intent Dataset for Indian Contexts
Overview
This dataset contains multilingual customer support queries across Indian contexts including ecommerce, banking, telecom, travel, and technology.
Features
Multilingual: English, Hindi, Hinglish, Punjabi
Intent labeled (refund, payment_issue, account_issue, delivery_issue, complaint)
Real-world customer queries
Use Cases
Customer support chatbots
Intent classification models… See the full description on the dataset page: https://huggingface.co/datasets/karanverma19/Multilingual_Customer_Support_Intent_Dataset_for_Indian_Contexts.APOO-Indian-Traffic-Dataset
APOO Indian Traffic Dataset
Synthetic training data for the Adaptive Platoon Offset Optimizer (APOO) — a framework for Indian traffic signal coordination.
Overview
5,000 synthetic samples calibrated for Indian heterogeneous traffic conditions, designed for training ML models that predict platoon travel time between signals.
Features (20 input features)
Feature
Description
Range
link_length_m
Distance between signals
150-600m
speed_limit_kmh
Posted… See the full description on the dataset page: https://huggingface.co/datasets/omshrivastava/APOO-Indian-Traffic-Dataset.indian_emotion_toned_dialogue_dataset_v2
Indian Emotion-Toned Dialogue Dataset (v2)
A culturally grounded dataset of 1 000 short dialogues written in Indian English, each labeled by one of 10 emotions and paired with a brief contextual note describing the setting or situation.
🧩 Structure
Column
Description
id
Row number (1 – 1000)
emotion
One of 10 emotion labels — Love, Anger, Nostalgia, Jealousy, Humor, Gratitude, Sadness, Hope, Surprise, Confusion
dialogue
Short human-style utterance or… See the full description on the dataset page: https://huggingface.co/datasets/VModiDataWorks/indian_emotion_toned_dialogue_dataset_v2.indian_recipe_datasetadarsh2626_indian-all-states-all-district-pollution-dataset
All Indian Districts Pollution Dataset
District-wise AQI data across India with peak levels, current status, and source
Dataset Info
Source: Kaggle
Original Size: 0.04 MB
Kaggle Downloads: 321
Files: 1
Files
all_india_districts_aqi.csv
Mirrored from Kaggle
Indian_Cyber_Scam_PhoneCall_Hinglish_Dataset
Indian Scam Communication Dataset
Overview
The Indian Scam Communication Dataset is a curated collection of scam-related messages, call transcripts, and fraud communication patterns commonly observed in India.
The dataset is designed for researchers, students, cybersecurity professionals, NLP engineers, and law-enforcement technology developers working on scam detection, fraud prevention, and conversational AI safety.
Motivation
India has witnessed… See the full description on the dataset page: https://huggingface.co/datasets/Vedantsc-1110/Indian_Cyber_Scam_PhoneCall_Hinglish_Dataset.multilingual-indian-instruction-dataset
Multilingual Context-Aware Instruction Dataset for Indian Use Cases
Overview
This dataset adapts multilingual instruction data to better support Indian languages such as Hindi, Hinglish, and Punjabi.
Purpose
It focuses on real-world use cases including:
Banking
Government services
Education
Daily life interactions
Key Features
Multilingual (English, Hindi, Hinglish, Punjabi)
Context-aware structure (instruction + context + response)… See the full description on the dataset page: https://huggingface.co/datasets/karanverma19/multilingual-indian-instruction-dataset.ak0212_indian-bike-sales-dataset
Indian Bike Sales Dataset
Motorcycle Sales Data Across Indian
Dataset Info
Source: Kaggle
Original Size: 0.26 MB
Kaggle Downloads: 4,749
Files: 1
Files
bike_sales_india.csv
Mirrored from Kaggle
Indian_Multilingual_Scam_Message_Dataset
Indian Multilingual Scam Message Dataset
Overview
This dataset contains 120 realistic SMS and text messages from Indian contexts, labeled as scam or legitimate. It reflects real-world communication patterns across Hindi, Hinglish, and English.
Features
120 high-quality samples
Multilingual (Hindi, Hinglish, English)
Real-world inspired scam and legitimate messages
Includes reasoning for each label
Covers multiple domains: banking, ecommerce, telecom, utilities… See the full description on the dataset page: https://huggingface.co/datasets/ganesh9353/Indian_Multilingual_Scam_Message_Dataset.Indian-EN-HIN-Dataste-TTSindian_peanl_code_dataset
