CoolFace
Datasetpublic

Supra-Nexus/supra-nexus-o1-training

Supra Nexus O1 Training Datasets Overview Comprehensive training datasets for Supra Nexus O1 models, including: Identity training Chain-of-thought reasoning Self-improvement examples (O1.5) Instruction following Datasets Included 1. Identity Dataset (supra_identity.jsonl) Model identity and alignment Organization information Capability descriptions 2. Instruction Dataset (supra_instruct_*.jsonl) Direct instruction… See the full description on the dataset page: https://huggingface.co/datasets/Supra-Nexus/supra-nexus-o1-training.

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
0likes293downloads
Dataset Card

Supra Nexus O1 Training Datasets

Overview

Comprehensive training datasets for Supra Nexus O1 models, including:

  • —Identity training
  • —Chain-of-thought reasoning
  • —Self-improvement examples (O1.5)
  • —Instruction following

Datasets Included

1. Identity Dataset (supra_identity.jsonl)

  • —Model identity and alignment
  • —Organization information
  • —Capability descriptions

2. Instruction Dataset (supra_instruct_*.jsonl)

  • —Direct instruction following
  • —Various task completions
  • —Code generation examples

3. Thinking Dataset (supra_thinking_*.jsonl)

  • —Chain-of-thought reasoning with <thinking> tags
  • —Mathematical reasoning
  • —Complex problem solving

4. Self-Improvement Dataset (nexus-o1-upgrade-1.jsonl)

  • —Recursive self-improvement examples
  • —Clean code organization patterns
  • —Meticulous vs sloppy implementation comparisons
  • —Learning from mistakes

Usage

python
from datasets import load_dataset

# Load all datasets
dataset = load_dataset("Supra-Nexus/supra-nexus-o1-training")

# Access specific splits
identity_data = dataset["identity"]
thinking_data = dataset["thinking"]
upgrade_data = dataset["upgrade"]

Training with Zoo Gym

bash
# Install Zoo Gym
pip install git+https://github.com/zooai/gym

# Train with identity dataset
gym train \
  --model_name_or_path "Supra-Nexus/supra-nexus-o1-instruct" \
  --dataset "Supra-Nexus/supra-nexus-o1-training" \
  --dataset_split "identity"

Dataset Statistics

DatasetExamplesAvg LengthPurpose
Identity20150 tokensModel alignment
Instruction50200 tokensTask completion
Thinking30500 tokensReasoning chains
Self-Improvement10800 tokensRecursive learning

Model Links

Citation

bibtex
@dataset{supranexus2025training,
  title={Supra Nexus O1 Training Datasets},
  author={Supra Foundation LLC},
  year={2025},
  publisher={HuggingFace}
}

License

Apache 2.0 - Free for research and commercial use.


© 2025 Supra Foundation LLC