n-pelleriti/alphadiana-swe-mini-direct-gemma4-20260725-m8v4
AlphaDiana SWE-Bench Verified Mini result Run ID: 20260724-swe_bench_verified_mini-direct-noharness-gemma-4-31b-it-h200-v01 Benchmark: SWE-Bench Verified Mini Agent/harness: Direct no-harness baseline via AlphaDiana Podman SWE harness Model: google/gemma-4-31B-it Slurm job: 2384072 Summary from local inspection: 50 task rows 49 valid_scored 1 runtime_error 0 provider_error 0 correct finish reasons: length=9, stop=41 valid-only accuracy: 0.0000 completed-row accuracy: 0.0000… See the full description on the dataset page: https://huggingface.co/datasets/n-pelleriti/alphadiana-swe-mini-direct-gemma4-20260725-m8v4.
AlphaDiana SWE-Bench Verified Mini result
Run ID: 20260724-swebenchverified_mini-direct-noharness-gemma-4-31b-it-h200-v01
Benchmark: SWE-Bench Verified Mini Agent/harness: Direct no-harness baseline via AlphaDiana Podman SWE harness Model: google/gemma-4-31B-it Slurm job: 2384072
Summary from local inspection:
- 50 task rows
- 49 valid_scored
- 1 runtime_error
- 0 provider_error
- 0 correct
- finish reasons: length=9, stop=41
- valid-only accuracy: 0.0000
- completed-row accuracy: 0.0000
- total-denominator pass@1/accuracy: 0.0000
Contents:
- results/20260724-swebenchverified_mini-direct-noharness-gemma-4-31b-it-h200-v01/: task JSONs, artifacts, logprob sidecars, status files
- results/20260724-swebenchverified_mini-direct-noharness-gemma-4-31b-it-h200-v01.jsonl: append-only run JSONL
- logs/: scratch run and vLLM logs when available
- repo_logs/: Slurm output and repo-side SWE task-container logs when available
