Web3Survivor/Onlineresearch
Computational STEM QA Dataset Dataset Summary This dataset contains computationally intensive, self-contained, and unambiguous STEM reasoning problems across Physics, Mathematics, Biology, and Chemistry. Problems require multi-step reasoning, symbolic manipulation, numerical accuracy, or simulation-based verification. These tasks expose failure modes in state-of-the-art LLMs, making this dataset a strong benchmark for evaluating deep reasoning. Each example… See the full description on the dataset page: https://huggingface.co/datasets/Web3Survivor/Onlineresearch.
Computational STEM QA Dataset
 
Dataset Summary
This dataset contains computationally intensive, self-contained, and unambiguous STEM reasoning problems across Physics, Mathematics, Biology, and Chemistry.
Problems require multi-step reasoning, symbolic manipulation, numerical accuracy, or simulation-based verification. These tasks expose failure modes in state-of-the-art LLMs, making this dataset a strong benchmark for evaluating deep reasoning.
Each example includes:
conversation_iddomainandsub-domain- A rigorous question with LaTeX
- A deterministic **answer`
- Optional Python code for simulation or verification
Dataset Structure
Example
{
"conversation_id": "201186",
"domain": "Physics",
"sub-domain": "Classical Mechanics",
"question": "A block of mass m slides down a frictionless incline... Compute the acceleration using $a = g \sin(\theta)$.",
"answer": "Using Newton's laws, the acceleration is $a = g \sin(\theta)$.",
"code": "import math\ng = 9.81\ntheta = math.radians(30)\na = g * math.sin(theta)\nprint(a)"
}Dataset Characteristics
- Self-contained and unambiguous
- Heavy use of LaTeX in STEM reasoning
- All examples require precise computation and can not be solved analytically
- Designed to stress-test LLM reasoning
- Full python code to solve the problem
Dataset Format
This dataset is provided in standard JSON format as a top-level array containing all problem records.
Example:
[
{"conversation_id": "1", "domain": "Physics", "sub-domain": "Mechanics", "question": "...", "answer": "...", "code": "..."},
{"conversation_id": "2", "domain": "Math", "sub-domain": "Algebra", "question": "...", "answer": "...", "code": "..."}
]Intended Uses
- Fine-tuning STEM reasoning models
- Evaluating LLM computation accuracy
- Benchmarking symbolic + numeric reasoning
- Developing STEM tutoring agents
- Creating reward models requiring strict correctness
Limitations
- Numeric results may vary slightly due to floating point behavior
- Python code assumes availability of only
numpy,scipypandaslibraries - Some models may require preprocessing of LaTeX
Citation
@dataset{saurabh_2025_stemqa,
title = {Computational STEM QA Dataset},
author = {Saurabh Patil,Anshuman Lall,Marko Pavlovic,Tejas Ukarde,Chinmayee Shukla,Mahesh Joshi,Kihwan Han},
year = {2025},
url = {https://huggingface.co/datasets/TuringEnterprises/Turing-Open-Reasoning/}
}