CoolFace
Datasetpublic

flavianv/deepoutfit-gpt41-brain-outfit500-first400

DeepOutfit GPT-4.1 Brain OUTFIT500 First 400 JSON-action outfit recommendation rollouts generated with GPT-4.1 as the policy brain and GPT-4.1 as the outfit judge. Contents data/rollouts.jsonl: rollout rows with messages, tool calls, final report, reward, diagnostics, and token usage. queries/outfit.json: exact input queries used for this run. summary.json: compact run summary. Run Summary { "job":… See the full description on the dataset page: https://huggingface.co/datasets/flavianv/deepoutfit-gpt41-brain-outfit500-first400.

sourceHugging Faceotherupdated 4mo agoView on Hugging Face
0likes7downloads
Dataset Card

DeepOutfit GPT-4.1 Brain OUTFIT500 First 400

JSON-action outfit recommendation rollouts generated with GPT-4.1 as the policy brain and GPT-4.1 as the outfit judge.

Contents

  • —data/rollouts.jsonl: rollout rows with messages, tool calls, final report, reward, diagnostics, and token usage.
  • —queries/outfit.json: exact input queries used for this run.
  • —summary.json: compact run summary.

Run Summary

json
{
  "job": "gpt41_brain_outfit500_first400_w8_20260530_143830",
  "source_path": "/home/criteo/reco-rl-json-action/outputs/gpt41_outfit_brain/gpt41_brain_outfit500_first400_w8_20260530_143830",
  "model": "gpt-4.1",
  "judge_model": "gpt-4.1",
  "harness_task": "outfit_search",
  "planning": "on",
  "max_workers": 8,
  "target_rows": 400,
  "rows": 400,
  "successes": 398,
  "failures": 2,
  "failure_modes": [
    "invalid_final_schema"
  ],
  "reward": {
    "mean": 88.8149,
    "median": 92.9667,
    "min": 42.3333,
    "max": 99.3333,
    "ge_70": 371,
    "ge_80": 331,
    "ge_90": 254
  }
}

Generation Setup

  • —Policy brain: gpt-4.1
  • —Judge: gpt-4.1
  • —Harness: outfit_search
  • —Planning: on
  • —Search budget: 5 tool calls
  • —Target products per report: 5
  • —Workers: 8