vaadewoyin/arxiv-ml-qa-dataset
ArXiv ML Q&A Dataset Dataset Description 951 high-quality Q&A pairs generated from ArXiv machine learning paper abstracts. Built for fine-tuning language models on technical ML questions. Repository: GitHub Repository - Source code for dataset generation, cleaning, and filtering. How It Was Built Scraped 2000+ ArXiv ML papers via ArXiv API (cat:cs.LG) Cleaned — deduplication, length filter (50–400 words) Generated — Llama-3-8B-Instruct via… See the full description on the dataset page: https://huggingface.co/datasets/vaadewoyin/arxiv-ml-qa-dataset.
ArXiv ML Q&A Dataset
Dataset Description
951 high-quality Q&A pairs generated from ArXiv machine learning paper abstracts. Built for fine-tuning language models on technical ML questions.
- Repository: GitHub Repository - Source code for dataset generation, cleaning, and filtering.
How It Was Built
- Scraped 2000+ ArXiv ML papers via ArXiv API (cat:cs.LG)
- Cleaned — deduplication, length filter (50–400 words)
- Generated — Llama-3-8B-Instruct via Unsloth on Kaggle
- Filtered — ChatML format validation, min question length - 10 words, min answer length - 20 words
Format
ChatML format: {"messages": [{"role": "user", "content": "question"}, {"role": "assistant", "content": "answer"}]}
Size
- Total pairs: 951
- Rejection rate: 8.9%
Known Limitations
- Groundedness assumed via prompt design, not verified programmatically
- Questions generated by 4-bit quantised model, some quality variance exists
