CoolFace
Datasetpublic

The-CoLab/multilingual-textarena-SimpleTak-v0-train

TextArena Language Trajectories This dataset contains language-conditioned TextArena trajectory data. Each dataset configuration corresponds to a different model, experiment group, or source folder. Available configurations: gemma4-e4b-it qwen3-4b ministral3-3b-instruct Usage Install the datasets library: pip install datasets Load a specific configuration: from datasets import load_dataset dataset =… See the full description on the dataset page: https://huggingface.co/datasets/The-CoLab/multilingual-textarena-SimpleTak-v0-train.

sourceHugging Facemitupdated 1mo agoView on Hugging Face
0likes145downloads
Dataset Card

TextArena Language Trajectories

This dataset contains language-conditioned TextArena trajectory data.

Each dataset configuration corresponds to a different model, experiment group, or source folder.

Available configurations:

  • gemma4-e4b-it
  • qwen3-4b
  • ministral3-3b-instruct

Usage

Install the datasets library:

pip install datasets

Load a specific configuration:

from datasets import load_dataset

dataset = load_dataset("The-CoLab/multilingual-textarena-SimpleTak-v0-train", name="gemma4-e4b-it")

The train split contains row-level trajectory records from the uploaded files.

Columns

Common columns may include:

  • game_idx
  • step_idx
  • env_id
  • pid
  • policy_id
  • model_name
  • observation
  • raw_action
  • rawactionlen
  • action
  • reward
  • policy_epoch
  • step_info
  • game_info
  • lang
  • lang_map

Some columns may vary depending on the original files.

Notes

Nested fields such as stepinfo, gameinfo, and lang_map are stored as strings for compatibility.