datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
StudyAbroadGPT-Dataset
StudyAbroadGPT Dataset
A synthetic, domain-specific conversational dataset (2,676 multi-turn conversations) designed for training and fine-tuning language models on study-abroad academic advising topics.
Current Status: Structural audit complete ✅ | Source-verified factuality audit complete ✅ (per arXiv:2504.15610v4 §4.4) | Caveat Phrase Usage regression flagged in §5.1
🔗 Project Ecosystem
Resource
Link
LoRA Model (fine-tuned)… See the full description on the dataset page: https://huggingface.co/datasets/millat/StudyAbroadGPT-Dataset.mille-agent-blueprints
MILLE Agent Blueprints
This dataset contains 200 synthetic, contract-checked examples for evaluating
agents that plan machine-learning systems. Each JSONL row pairs a plain-language
ML system request with a MILLE-generated expected blueprint, a dataset profile
when sample CSV data is available, rubric criteria, and known failure modes.
What it demonstrates
Evaluation across six ML task families and 24 operational domains
Explicit contracts for task framing… See the full description on the dataset page: https://huggingface.co/datasets/AhmedMSLTI/mille-agent-blueprints.study-in-india-faq
Study-in-India FAQ Dataset
This dataset, study-in-india-faq, is designed for fine-tuning language models to answer frequently asked questions about studying in India. It includes 200,000 pairs of questions and answers covering topics such as admissions, scholarships, accommodation, cultural adjustments, and visa requirements.
Dataset Summary
The study-in-india-faq dataset is a comprehensive resource for students seeking information about studying in India, whether they… See the full description on the dataset page: https://huggingface.co/datasets/millat/study-in-india-faq.turkish-wikipedia-qa-4-million
Turkish Wikipedia Question-Answering Dataset
Overview
A large-scale Turkish question-answering dataset generated from Wikipedia articles using an 8B parameter language model. Contains 449,844 rows and 4 million question-answer pairs derived from Turkish Wikipedia articles.
Dataset Versions
Current (Public): 2023 v1 - Generated with 8B parameter model
Gated Access:
2023 v2 - Generated with 70B parameter model, improved QA quality and diversity
2024 version -… See the full description on the dataset page: https://huggingface.co/datasets/hcsolakoglu/turkish-wikipedia-qa-4-million.
