CoolFace
Datasetpublic

reasoning-degeneration-dev/t1-arena-frozenlake-together_ai-qwen-qwen3-next-80b-a3b-thin-f51f5776

t1-arena-frozenlake-together_ai-qwen-qwen3-next-80b-a3b-thin-f51f5776 TextArena interactive evaluation of together_ai/Qwen/Qwen3-Next-80B-A3B-Thinking. Games: FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0. Results: 10/10 wins, 0 errors. Dataset Info Rows: 10 Columns: 9 Columns Column Type Description game_id Value('string') Unique… See the full description on the dataset page: https://huggingface.co/datasets/reasoning-degeneration-dev/t1-arena-frozenlake-together_ai-qwen-qwen3-next-80b-a3b-thin-f51f5776.

sourceHugging Facemitupdated 7mo agoView on Hugging Face
0likes9downloads
Dataset Card

t1-arena-frozenlake-together_ai-qwen-qwen3-next-80b-a3b-thin-f51f5776

TextArena interactive evaluation of together_ai/Qwen/Qwen3-Next-80B-A3B-Thinking. Games: FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0. Results: 10/10 wins, 0 errors.

Dataset Info

  • —Rows: 10
  • —Columns: 9

Columns

ColumnTypeDescription
game_idValue('string')Unique identifier for this game episode (env_id + episode number)
env_idValue('string')TextArena environment ID (e.g. FrozenLake-v0)
modelValue('string')Primary model name being evaluated
opponent_modelValue('null')Opponent model name (null for single-player games)
player_idValue('int64')Player slot the primary model occupied
rewardValue('float64')Final reward (+1 win, -1 loss, null on error)
num_turnsValue('int64')Total turns played in this episode
transcriptValue('string')JSON array of turns with observation and action per turn
errorValue('null')Error message if the game terminated abnormally (null otherwise)

Generation Parameters

json
{
  "script_name": "03_arena_eval.py",
  "model": "together_ai/Qwen/Qwen3-Next-80B-A3B-Thinking",
  "hyperparameters": {
    "temperature": 0.7,
    "top_p": 0.95,
    "max_tokens": 32768,
    "enable_thinking": true,
    "max_rounds": 200
  },
  "input_datasets": [],
  "description": "TextArena interactive evaluation of together_ai/Qwen/Qwen3-Next-80B-A3B-Thinking. Games: FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0, FrozenLake-v0. Results: 10/10 wins, 0 errors.",
  "custom_metadata": {
    "experiment_name": "t1_synthesize_knowledge_improvement",
    "stage": "arena_evaluation",
    "run_tag": "f51f5776",
    "system_prompt": null,
    "game_configs": [
      {
        "env_id": "FrozenLake-v0",
        "num_episodes": 1,
        "num_players": 1,
        "env_kwargs": {
          "size": 5,
          "num_holes": 6,
          "randomize_start_goal": true
        }
      },
      {
        "env_id": "FrozenLake-v0",
        "num_episodes": 1,
        "num_players": 1,
        "env_kwargs": {
          "size": 5,
          "num_holes": 5,
          "randomize_start_goal": true
        }
      },
      {
        "env_id": "FrozenLake-v0",
        "num_episodes": 1,
        "num_players": 1,
        "env_kwargs": {
          "size": 8,
          "num_holes": 12,
          "randomize_start_goal": true
        }
      },
      {
        "env_id": "FrozenLake-v0",
        "num_episodes": 1,
        "num_players": 1,
        "env_kwargs": {
          "size": 2,
          "num_holes": 1,
          "randomize_start_goal": true
        }
      },
      {
        "env_id": "FrozenLake-v0",
        "num_episodes": 1,
        "num_players": 1,
        "env_kwargs": {
          "size": 3,
          "num_holes": 2,
          "randomize_start_goal": true
        }
      },
      {
        "env_id": "FrozenLake-v0",
        "num_episodes": 1,
        "num_players": 1,
        "env_kwargs": {
          "size": 7,
          "num_holes": 13,
          "randomize_start_goal": true
        }
      },
      {
        "env_id": "FrozenLake-v0",
        "num_episodes": 1,
        "num_players": 1,
        "env_kwargs": {
          "size": 9,
          "num_holes": 25,
          "randomize_start_goal": true
        }
      },
      {
        "env_id": "FrozenLake-v0",
        "num_episodes": 1,
        "num_players": 1,
        "env_kwargs": {
          "size": 5,
          "num_holes": 7,
          "randomize_start_goal": true
        }
      },
      {
        "env_id": "FrozenLake-v0",
        "num_episodes": 1,
        "num_players": 1,
        "env_kwargs": {
          "size": 6,
          "num_holes": 12,
          "randomize_start_goal": true
        }
      },
      {
        "env_id": "FrozenLake-v0",
        "num_episodes": 1,
        "num_players": 1,
        "env_kwargs": {
          "size": 7,
          "num_holes": 14,
          "randomize_start_goal": true
        }
      }
    ]
  }
}

Usage

python
from datasets import load_dataset

dataset = load_dataset("reasoning-degeneration-dev/t1-arena-frozenlake-together_ai-qwen-qwen3-next-80b-a3b-thin-f51f5776", split="train")
print(f"Loaded {len(dataset)} rows")

This dataset is tracked in [reasoning-degeneration-dev/PROJECT-MANIFEST](https://huggingface.co/datasets/reasoning-degeneration-dev/PROJECT-MANIFEST)