JiaaqiLiu/SkillArena-datasets
SkillArena Offline Datasets Offline evaluation data for SkillArena — a validated automatic benchmark generation framework for AI agent skills, targeting NeurIPS 2026 Datasets & Benchmarks Track. Overview This dataset provides domain-specific task input data for 289 AI agent skills across 13 domains. Each skill has 50 curated data files designed as meaningful agent task inputs — files an agent could receive and act upon (analyze, transform, validate, or generate… See the full description on the dataset page: https://huggingface.co/datasets/JiaaqiLiu/SkillArena-datasets.
SkillArena Offline Datasets
Offline evaluation data for SkillArena — a validated automatic benchmark generation framework for AI agent skills, targeting NeurIPS 2026 Datasets & Benchmarks Track.
Overview
This dataset provides domain-specific task input data for 289 AI agent skills across 13 domains. Each skill has 50 curated data files designed as meaningful agent task inputs — files an agent could receive and act upon (analyze, transform, validate, or generate from). The data is used by SkillArena's 10-stage evaluation pipeline to automatically generate validated evaluation tasks, graders, and pilot tests.
Dataset Structure
skillarena-datasets/
├── skills/ # 289 skills × 50 files = 14,450 files
│ ├── scikit-learn/ # ML training domain
│ │ ├── ml_training_csv_00.csv # Classification dataset
│ │ ├── ml_training_csv_01.csv # Regression dataset
│ │ ├── ... # 18 more CSV files
│ │ ├── ml_training_json_00.json # Model config
│ │ ├── ... # 11 more JSON files
│ │ ├── ml_training_yaml_00.yaml # Training pipeline config
│ │ ├── ... # 9 more YAML files
│ │ ├── ml_training_md_00.md # Model card
│ │ ├── ... # 4 more Markdown files
│ │ ├── ml_training_txt_00.txt # Training log
│ │ └── ... # 2 more text files
│ ├── langchain/ # NLP/LLM domain
│ ├── grafana-dashboards/ # DevOps/Infra domain
│ ├── rdkit/ # Chemistry domain
│ └── ... # 285 more skill directories
├── original-skills/ # 16 core skills (hand-curated, 10 files each)
│ ├── pdf/ # PDFs, extraction configs
│ ├── xlsx/ # Spreadsheets, CSV data
│ ├── frontend-design/ # HTML, CSS, JS, design specs
│ └── ... # 13 more original skills
└── index.json # Dataset index with file metadataFile Distribution Per Skill
Every skill receives exactly 50 files with a fixed distribution:
Total across all skills: 5,780 CSV + 3,468 JSON + 2,890 YAML + 1,445 MD + 867 TXT = 14,450 files
Domain Classification
Skills are classified into 13 domains, each with a specialized data generator:
Data Content Examples
CSV — ML Training (scikit-learn)
feature_0,feature_1,feature_2,feature_3,target,split
0.83,0.17,-0.45,1.02,1,train
-0.22,0.91,0.33,-0.67,0,trainJSON — NLP/LLM (langchain)
{
"chain_name": "qa_retrieval_chain",
"chain_type": "stuff",
"retriever": {
"type": "vectorstore",
"search_type": "similarity",
"search_kwargs": {"k": 4}
}
}YAML — DevOps (k8s-manifest-generator)
apiVersion: apps/v1
kind: Deployment
metadata:
name: api-gateway
namespace: production
spec:
replicas: 3
strategy:
type: RollingUpdateHow It's Used
SkillArena's pipeline uses these files in the Data Acquisition stage:
SKILL.md → Analyze → Plan → Synthesize → [Data Acquisition] → Grade → Validate → Meta-Eval → Pilot → Promote
↑
This dataset provides
input data for tasksThe OfflineDataProvider is the first source in an 8-provider chain:
Offline Dataset (this) → GitHub → Web Search → Kaggle → HuggingFace → Programmatic → Binary Renderer → LLM SynthesisWhen a task is generated, the provider:
- Looks up
skills/{skill_name}/directory - Picks the first unused file (sorted alphabetically)
- Copies it to
task_dir/input/input.{ext}as the agent's input
Original Skills (16)
These hand-curated skills have been validated through the full SkillArena pipeline:
Average quality score: 9.12/10 | Validation pass rate: 100% (162/162 tasks)
Generation & Validation
All 14,450 files are deterministically generated using domain-specific generators with per-skill random seeds (hash(skill_name) & 0xFFFFFFFF) for full reproducibility.
Validation checks (all passing):
- File count: exactly 50 per skill (20 CSV + 12 JSON + 10 YAML + 5 MD + 3 TXT)
- Minimum file size: >= 500 bytes
- Format validity: CSV parseable with consistent column counts, JSON/YAML parseable
- CSV integrity: header + data rows, no empty columns, consistent column count
- Markdown: has headers and substantial content
- No source code leakage: no Python/Java/Go/JS imports in data files
- Filename convention:
{domain}_{ext}_{NN}.{ext}pattern
Regeneration
# Generate all skills
python -m scripts.generate_task_inputs.main --force
# Single skill
python -m scripts.generate_task_inputs.main --skill scikit-learn --force
# Validate only
python -m scripts.generate_task_inputs.main --validate-only
# Deep validation
python scripts/generate_task_inputs/deep_validate.pyUsage
from skillarena.pipeline.orchestrator import PipelineOrchestrator
orchestrator = PipelineOrchestrator(
output_dir="pipeline_output",
offline_data_dir="skillarena-datasets", # Point to this dataset
seed=42
)
state = await orchestrator.run(skill_path="skills/pdf/SKILL.md")Citation
@inproceedings{liu2026skillarena,
title={SkillArena: Validated Automatic Benchmark Generation for AI Agent Skills},
author={Liu, Jiaqi},
booktitle={NeurIPS 2026 Datasets and Benchmarks Track},
year={2026}
}License
MIT License — see the SkillArena repository for details.
