CoolFace
Datasetpublic

n-pelleriti/alphadiana-swe-mini-direct-gemma4-20260725-m8v4

AlphaDiana SWE-Bench Verified Mini result Run ID: 20260724-swe_bench_verified_mini-direct-noharness-gemma-4-31b-it-h200-v01 Benchmark: SWE-Bench Verified Mini Agent/harness: Direct no-harness baseline via AlphaDiana Podman SWE harness Model: google/gemma-4-31B-it Slurm job: 2384072 Summary from local inspection: 50 task rows 49 valid_scored 1 runtime_error 0 provider_error 0 correct finish reasons: length=9, stop=41 valid-only accuracy: 0.0000 completed-row accuracy: 0.0000… See the full description on the dataset page: https://huggingface.co/datasets/n-pelleriti/alphadiana-swe-mini-direct-gemma4-20260725-m8v4.

sourceHugging Faceupdated 2mo agoView on Hugging Face
0likes175downloads
Dataset Card

AlphaDiana SWE-Bench Verified Mini result

Run ID: 20260724-swebenchverified_mini-direct-noharness-gemma-4-31b-it-h200-v01

Benchmark: SWE-Bench Verified Mini Agent/harness: Direct no-harness baseline via AlphaDiana Podman SWE harness Model: google/gemma-4-31B-it Slurm job: 2384072

Summary from local inspection:

  • —50 task rows
  • —49 valid_scored
  • —1 runtime_error
  • —0 provider_error
  • —0 correct
  • —finish reasons: length=9, stop=41
  • —valid-only accuracy: 0.0000
  • —completed-row accuracy: 0.0000
  • —total-denominator pass@1/accuracy: 0.0000

Contents:

  • —results/20260724-swebenchverified_mini-direct-noharness-gemma-4-31b-it-h200-v01/: task JSONs, artifacts, logprob sidecars, status files
  • —results/20260724-swebenchverified_mini-direct-noharness-gemma-4-31b-it-h200-v01.jsonl: append-only run JSONL
  • —logs/: scratch run and vLLM logs when available
  • —repo_logs/: Slurm output and repo-side SWE task-container logs when available