akenginorhun/neurips-2026-evals
NeurIPS 2026 Agent Evaluation Dataset This dataset contains evaluation results for various AI agents across multiple benchmarks. Dataset Structure The dataset is organized by model (as configs) with each benchmark as a split. Each model/benchmark folder contains: Main results file (.jsonl or .parquet format) Summary statistics (.summary.json) - for models with metadata Configuration file (.toml) - for models with metadata Traces folder with execution traces… See the full description on the dataset page: https://huggingface.co/datasets/akenginorhun/neurips-2026-evals.
NeurIPS 2026 Agent Evaluation Dataset
This dataset contains evaluation results for various AI agents across multiple benchmarks.
Dataset Structure
The dataset is organized by model (as configs) with each benchmark as a split.
Each model/benchmark folder contains:
- Main results file (
.jsonlor.parquetformat) - Summary statistics (
.summary.json) - for models with metadata - Configuration file (
.toml) - for models with metadata - Traces folder with execution traces (
traces/traces.jsonl) - for models with metadata
Models
claude-opus: 9 benchmarksgemini-31-pro: 9 benchmarksgemma4-e4b: 7 benchmarksgpt-54: 9 benchmarkskimi-k25: 4 benchmarkslfm-12b: 7 benchmarksminimax-m25: 7 benchmarksnemotron-nano-30b: 7 benchmarksnemotron-nano-4b-fp8: 7 benchmarksqwen-27b: 6 benchmarksqwen-2b: 7 benchmarksqwen-397b: 7 benchmarksqwen-4b: 6 benchmarksqwen-9b: 7 benchmarkstrinity-large: 7 benchmarks
Benchmarks
deepresearchgaialivecodebenchliveresearchliveresearchbenchpinchbenchtaubenchtaubench_telecomterminalbenchtoolcall15
Usage
from datasets import load_dataset
# Load a specific model's results
dataset = load_dataset('akenginorhun/neurips-2026-evals', name='claude-opus')
# Load a specific benchmark for a model
dataset = load_dataset('akenginorhun/neurips-2026-evals', name='qwen-27b', split='gaia')