openscience
OpenScienceReasoning-2
Dataset Description
OpenScienceReasoning-2 is a multi-domain synthetic dataset designed to improve general-purpose reasoning in large language models (LLMs). The dataset contains multiple-choice and open-ended question-answer pairs with detailed reasoning traces and spans across diverse scientific domains, including STEM, law, economics, and humanities. OpenScience aims to boost accuracy on advanced benchmarks such as GPQA-Diamond, MMLU-Pro and HLE via supervised finetuning or… See the full description on the dataset page: https://huggingface.co/datasets/nvidia/OpenScienceReasoning-2.OpenScience
Dataset Description:
OpenScience is a multi-domain synthetic dataset designed to improve general-purpose reasoning in large language models (LLMs). The dataset contains multiple-choice question-answer pairs with detailed reasoning traces and spans across diverse scientific domains, including STEM, law, economics, and humanities. OpenScience aims to boost accuracy on advanced benchmarks such as GPQA-Diamond and MMLU-Pro via supervised finetuning or reinforcement learning.
This… See the full description on the dataset page: https://huggingface.co/datasets/nvidia/OpenScience.OpenScience
Open Science Dataset
Overview
Open Science is a large-scale, permissively licensed text dataset derived from OpenAlex, containing over 100B (105,390,332,599) words. OpenAlex is an open database of scholarly publications, authors, institutions, and research outputs that serves as a comprehensive source for academic literature.
Key Features
Truly Open: Contains only permissively licensed data suitable for both commercial and non-commercial use
Multilingual… See the full description on the dataset page: https://huggingface.co/datasets/LLMDH/OpenScience.OpenScienceReasoning-2-50K
OpenScienceReasoning-2-50K
This repository contains a random 50,000 sample subset of the NVIDIA OpenScienceReasoning-2 dataset.
Open-Science-Evaluation
AIPOCH Open-Science evaluation materials
This collection accompanies AIPOCH Open-Science: A Local-First, Model-Agnostic and Auditable AI Research Workbench (manuscript v2). It contains nine archived scientific runs, a separate synthetic artifact-verification demonstration, supplementary benchmark records and a pinned snapshot of the case-preparation repository.
Run index
Only the outer presentation folders were added. Original directory names, files, archived code… See the full description on the dataset page: https://huggingface.co/datasets/AIPOCH-AI/Open-Science-Evaluation.OpenScience-Chinese-Reasoning-SFT
OpenScience-Chinese
A Chinese multiple-choice science QA dataset with chain-of-thought reasoning, derived from nvidia/OpenScience through translation and rejection sampling.
Key Features:
Scale: 50,000 high-quality instances.
Reasoning: Built-in Chain-of-Thought (<think> tags) for interpretable AI.
Reliability: Rejection sampling ensures 100% alignment with ground truth.
Data Source
The questions originate from nvidia/OpenScience, a large-scale science QA dataset… See the full description on the dataset page: https://huggingface.co/datasets/zake7749/OpenScience-Chinese-Reasoning-SFT.
