CoolFace
Datasetpublic

FineEnvs/data-agent-experiment-results

Data Agent: public artifact index Qwen3.5-2B training with Harbor multi-harness, native OpenCode, Harbor OpenCode-only and SETA. This is a frozen report release from September 16, 2026. The live Trackio dashboard continues updating. Latest update September 16, 19:49 UTC: live eval progress and failure diagnosis. Includes recovery jobs, transport failures, and the measured OpenCode output-truncation regression. Earlier evaluation plot and GPU allocation update.… See the full description on the dataset page: https://huggingface.co/datasets/FineEnvs/data-agent-experiment-results.

sourceHugging Faceupdated 2d agoView on Hugging Face
0likes197downloads
UI_VERIFIED.json235 linesDownload Raw Back to comparison
1{2  "url": "https://huggingenvs-data-agent-training-comparison-trackio.hf.space/?project=qwen35-2b-harbor-vs-opencode-20260916&run_ids=3ae29a23763093285702b71a1f76805a%2Cbeb2604c8f737da4262b1ab19b8b0cbd&smoothing=0&metric_filter=%5E%28eval%2Fpass_at_1%7Ctrain%2Freward_rolling20%29%24",3  "runs": {4    "Native OpenCode": {5      "training_steps": 1000,6      "evaluation_scores": {7        "0": 0.159,8        "100": 0.197,9        "200": 0.221,10        "300": 0.216,11        "400": 0.264,12        "500": 0.231,13        "600": 0.251,14        "700": 0.23215      },16      "metric_names": [17        "eval/delta_from_baseline",18        "eval/difficulty/easy/pass_at_1",19        "eval/difficulty/hard/pass_at_1",20        "eval/difficulty/medium/pass_at_1",21        "eval/graded_cells",22        "eval/harness/claude-code/pass_at_1",23        "eval/harness/codex/pass_at_1",24        "eval/harness/mini-swe-agent/pass_at_1",25        "eval/harness/opencode/pass_at_1",26        "eval/harness_difficulty/claude-code/easy/pass_at_1",27        "eval/harness_difficulty/claude-code/hard/pass_at_1",28        "eval/harness_difficulty/claude-code/medium/pass_at_1",29        "eval/harness_difficulty/codex/easy/pass_at_1",30        "eval/harness_difficulty/codex/hard/pass_at_1",31        "eval/harness_difficulty/codex/medium/pass_at_1",32        "eval/harness_difficulty/mini-swe-agent/easy/pass_at_1",33        "eval/harness_difficulty/mini-swe-agent/hard/pass_at_1",34        "eval/harness_difficulty/mini-swe-agent/medium/pass_at_1",35        "eval/harness_difficulty/opencode/easy/pass_at_1",36        "eval/harness_difficulty/opencode/hard/pass_at_1",37        "eval/harness_difficulty/opencode/medium/pass_at_1",38        "eval/pass_at_1",39        "train/admission/outstanding_rollouts_max",40        "train/admission/stale_rollouts_dropped_total",41        "train/batch/forwarded_tokens_per_step",42        "train/batch/groups_per_step",43        "train/batch/masked_token_frac",44        "train/batch/microbatches_per_step",45        "train/batch/pad_frac",46        "train/batch/row_fill_frac",47        "train/batch/row_imbalance",48        "train/batch/row_tokens_max",49        "train/batch/row_tokens_mean",50        "train/batch/samples_per_row",51        "train/batch/samples_per_step",52        "train/batch/trained_tokens_per_step",53        "train/clip_ratio/high_max",54        "train/clip_ratio/high_mean",55        "train/clip_ratio/low_mean",56        "train/clip_ratio/low_min",57        "train/clip_ratio/region_mean",58        "train/completions/clipped_ratio",59        "train/completions/max_length",60        "train/completions/mean_length",61        "train/completions/min_length",62        "train/entropy",63        "train/epoch",64        "train/grad_norm",65        "train/kl",66        "train/learning_rate",67        "train/loss",68        "train/nonzero_gradient_rolling20",69        "train/perf/forwarded_tok_s_fwd_bwd",70        "train/perf/forwarded_tok_s_wall_clock",71        "train/perf/fwd_bwd_s",72        "train/perf/fwd_s",73        "train/perf/mfu_fwd_bwd",74        "train/perf/mfu_wall_clock",75        "train/perf/optimizer_s",76        "train/perf/rollout_wait_s",77        "train/perf/step_s",78        "train/perf/trained_tok_s_wall_clock",79        "train/perf/weight_sync_barrier_s",80        "train/perf/weight_sync_pause_s",81        "train/perf/weight_sync_s",82        "train/perf/weight_sync_transfer_s",83        "train/ratio",84        "train/reward",85        "train/reward_rolling20",86        "train/reward_std",87        "train/rewards/harness_reward",88        "train/rollout/drift_tokens_max",89        "train/rollout/drift_tokens_mean",90        "train/rollout/duration_s",91        "train/rollout/fork_frac",92        "train/rollout/generated_tok_s",93        "train/rollout/inflight",94        "train/rollout/realign_frac",95        "train/rollout/samples_per_rollout",96        "train/rollout/score_queue_size",97        "train/rollout/score_s",98        "train/rollout/score_wait_s",99        "train/rollout/turns_max",100        "train/rollout/turns_mean",101        "train/sample/dropped_stale_total",102        "train/sample/forwarded_tokens_max",103        "train/sample/forwarded_tokens_mean",104        "train/sample/rollout_queue_size",105        "train/sample/staleness_max",106        "train/sample/staleness_mean",107        "train/sample/time_in_queue_s",108        "train/sample/trained_tokens_mean",109        "train/tools/call_frequency",110        "train/tools/failure_frequency"111      ]112    },113    "Harbor multi-harness": {114      "training_steps": 1000,115      "evaluation_scores": {116        "0": 0.146,117        "100": 0.248,118        "200": 0.263,119        "300": 0.286,120        "400": 0.33299999999999996,121        "500": 0.37000000000000005,122        "600": 0.318,123        "684": 0.321,124        "700": 0.288,125        "800": 0.27126      },127      "metric_names": [128        "eval/delta_from_baseline",129        "eval/difficulty/easy/pass_at_1",130        "eval/difficulty/hard/pass_at_1",131        "eval/difficulty/medium/pass_at_1",132        "eval/graded_cells",133        "eval/harness/claude-code/pass_at_1",134        "eval/harness/codex/pass_at_1",135        "eval/harness/mini-swe-agent/pass_at_1",136        "eval/harness/opencode/pass_at_1",137        "eval/harness_difficulty/claude-code/easy/pass_at_1",138        "eval/harness_difficulty/claude-code/hard/pass_at_1",139        "eval/harness_difficulty/claude-code/medium/pass_at_1",140        "eval/harness_difficulty/codex/easy/pass_at_1",141        "eval/harness_difficulty/codex/hard/pass_at_1",142        "eval/harness_difficulty/codex/medium/pass_at_1",143        "eval/harness_difficulty/mini-swe-agent/easy/pass_at_1",144        "eval/harness_difficulty/mini-swe-agent/hard/pass_at_1",145        "eval/harness_difficulty/mini-swe-agent/medium/pass_at_1",146        "eval/harness_difficulty/opencode/easy/pass_at_1",147        "eval/harness_difficulty/opencode/hard/pass_at_1",148        "eval/harness_difficulty/opencode/medium/pass_at_1",149        "eval/pass_at_1",150        "train/admission/outstanding_rollouts_max",151        "train/admission/stale_rollouts_dropped",152        "train/admission/stale_rollouts_dropped_total",153        "train/batch/forwarded_tokens_per_step",154        "train/batch/groups_per_step",155        "train/batch/masked_token_frac",156        "train/batch/microbatches_per_step",157        "train/batch/pad_frac",158        "train/batch/row_fill_frac",159        "train/batch/row_imbalance",160        "train/batch/row_tokens_max",161        "train/batch/row_tokens_mean",162        "train/batch/samples_per_row",163        "train/batch/samples_per_step",164        "train/batch/trained_tokens_per_step",165        "train/clip_ratio/high_max",166        "train/clip_ratio/high_mean",167        "train/clip_ratio/low_mean",168        "train/clip_ratio/low_min",169        "train/clip_ratio/region_mean",170        "train/completions/clipped_ratio",171        "train/completions/max_length",172        "train/completions/mean_length",173        "train/completions/min_length",174        "train/entropy",175        "train/epoch",176        "train/grad_norm",177        "train/kl",178        "train/learning_rate",179        "train/loss",180        "train/nonzero_gradient_rolling20",181        "train/perf/forwarded_tok_s_fwd_bwd",182        "train/perf/forwarded_tok_s_wall_clock",183        "train/perf/fwd_bwd_s",184        "train/perf/fwd_s",185        "train/perf/mfu_fwd_bwd",186        "train/perf/mfu_wall_clock",187        "train/perf/optimizer_s",188        "train/perf/rollout_wait_s",189        "train/perf/step_s",190        "train/perf/trained_tok_s_wall_clock",191        "train/perf/weight_sync_barrier_s",192        "train/perf/weight_sync_pause_s",193        "train/perf/weight_sync_s",194        "train/perf/weight_sync_transfer_s",195        "train/ratio",196        "train/reward",197        "train/reward_rolling20",198        "train/reward_std",199        "train/rewards/harness_reward",200        "train/rollout/drift_tokens_max",201        "train/rollout/drift_tokens_mean",202        "train/rollout/duration_s",203        "train/rollout/fork_frac",204        "train/rollout/generated_tok_s",205        "train/rollout/inflight",206        "train/rollout/realign_frac",207        "train/rollout/samples_per_rollout",208        "train/rollout/score_queue_size",209        "train/rollout/score_s",210        "train/rollout/score_wait_s",211        "train/rollout/turns_max",212        "train/rollout/turns_mean",213        "train/sample/dropped_stale_total",214        "train/sample/forwarded_tokens_max",215        "train/sample/forwarded_tokens_mean",216        "train/sample/rollout_queue_size",217        "train/sample/staleness_max",218        "train/sample/staleness_mean",219        "train/sample/time_in_queue_s",220        "train/sample/trained_tokens_mean",221        "train/tools/call_frequency",222        "train/tools/failure_frequency"223      ]224    }225  },226  "javascript_errors": [],227  "public_unauthenticated_browser": true,228  "views_checked": [229    "overview",230    "difficulty",231    "harness",232    "harness-difficulty"233  ]234}235