CoolFace
Datasetpublic

vaadewoyin/arxiv-ml-qa-dataset

ArXiv ML Q&A Dataset Dataset Description 951 high-quality Q&A pairs generated from ArXiv machine learning paper abstracts. Built for fine-tuning language models on technical ML questions. Repository: GitHub Repository - Source code for dataset generation, cleaning, and filtering. How It Was Built Scraped 2000+ ArXiv ML papers via ArXiv API (cat:cs.LG) Cleaned — deduplication, length filter (50–400 words) Generated — Llama-3-8B-Instruct via… See the full description on the dataset page: https://huggingface.co/datasets/vaadewoyin/arxiv-ml-qa-dataset.

sourceHugging Facemitupdated 4mo agoView on Hugging Face
0likes9downloads
Dataset Card

ArXiv ML Q&A Dataset

Dataset Description

951 high-quality Q&A pairs generated from ArXiv machine learning paper abstracts. Built for fine-tuning language models on technical ML questions.

  • —Repository: GitHub Repository - Source code for dataset generation, cleaning, and filtering.

How It Was Built

  1. 1.Scraped 2000+ ArXiv ML papers via ArXiv API (cat:cs.LG)
  2. 2.Cleaned — deduplication, length filter (50–400 words)
  3. 3.Generated — Llama-3-8B-Instruct via Unsloth on Kaggle
  4. 4.Filtered — ChatML format validation, min question length - 10 words, min answer length - 20 words

Format

ChatML format: {"messages": [{"role": "user", "content": "question"}, {"role": "assistant", "content": "answer"}]}

Size

  • —Total pairs: 951
  • —Rejection rate: 8.9%

Known Limitations

  • —Groundedness assumed via prompt design, not verified programmatically
  • —Questions generated by 4-bit quantised model, some quality variance exists