flavianv/deepoutfit-gpt41-brain-outfit500-first400
DeepOutfit GPT-4.1 Brain OUTFIT500 First 400 JSON-action outfit recommendation rollouts generated with GPT-4.1 as the policy brain and GPT-4.1 as the outfit judge. Contents data/rollouts.jsonl: rollout rows with messages, tool calls, final report, reward, diagnostics, and token usage. queries/outfit.json: exact input queries used for this run. summary.json: compact run summary. Run Summary { "job":… See the full description on the dataset page: https://huggingface.co/datasets/flavianv/deepoutfit-gpt41-brain-outfit500-first400.
07
DeepOutfit GPT-4.1 Brain OUTFIT500 First 400
JSON-action outfit recommendation rollouts generated with GPT-4.1 as the policy brain and GPT-4.1 as the outfit judge.
Contents
data/rollouts.jsonl: rollout rows with messages, tool calls, final report, reward, diagnostics, and token usage.queries/outfit.json: exact input queries used for this run.summary.json: compact run summary.
Run Summary
{
"job": "gpt41_brain_outfit500_first400_w8_20260530_143830",
"source_path": "/home/criteo/reco-rl-json-action/outputs/gpt41_outfit_brain/gpt41_brain_outfit500_first400_w8_20260530_143830",
"model": "gpt-4.1",
"judge_model": "gpt-4.1",
"harness_task": "outfit_search",
"planning": "on",
"max_workers": 8,
"target_rows": 400,
"rows": 400,
"successes": 398,
"failures": 2,
"failure_modes": [
"invalid_final_schema"
],
"reward": {
"mean": 88.8149,
"median": 92.9667,
"min": 42.3333,
"max": 99.3333,
"ge_70": 371,
"ge_80": 331,
"ge_90": 254
}
}Generation Setup
- Policy brain:
gpt-4.1 - Judge:
gpt-4.1 - Harness:
outfit_search - Planning:
on - Search budget: 5 tool calls
- Target products per report: 5
- Workers: 8
