helloelwin/Qwen3-32B_10episodes_comparisons_full
Qwen3-32B_10episodes_comparisons_full This is a pairwise comparison dataset created from SWE-bench evaluation results. Files Qwen3-32B_10episodes_comparisons_full_comparison_pairs.jsonl: JSONL file containing comparison pairs Metadata { "dataset_name": "Qwen3-32B_10episodes_comparisons_full", "model_name": "Qwen3-32B", "num_episodes": 10, "episodes_used": [ 1, 2, 3, 4, 5, 6, 7, 8, 9, 10 ]… See the full description on the dataset page: https://huggingface.co/datasets/helloelwin/Qwen3-32B_10episodes_comparisons_full.
Qwen3-32B10episodescomparisons_full
This is a pairwise comparison dataset created from SWE-bench evaluation results.
Dataset Description
- Model: Qwen3-32B
- Episodes used: [1, 2, 3, 4, 5, 6, 7, 8, 9, 10]
- Total comparison pairs: 225
- Resolved pairs: 67
- Unresolved pairs: 158
- Problems analyzed: 500
- Problems with successes: 70
- Problems with failures: 497
- Problems skipped: 275
Files
Qwen3-32B_10episodes_comparisons_full_comparison_pairs.jsonl: JSONL file containing comparison pairs
Metadata
{
"dataset_name": "Qwen3-32B_10episodes_comparisons_full",
"model_name": "Qwen3-32B",
"num_episodes": 10,
"episodes_used": [
1,
2,
3,
4,
5,
6,
7,
8,
9,
10
],
"statistics": {
"total_problems": 500,
"problems_with_success": 70,
"problems_with_failure": 497,
"problems_skipped": 275,
"comparison_pairs_created": 225,
"resolved_pairs": 67,
"unresolved_pairs": 158
}
}Usage
import json
from datasets import load_dataset
# Load using Hugging Face datasets
dataset = load_dataset("helloelwin/Qwen3-32B_10episodes_comparisons_full")
# Or load manually
pairs = []
with open('Qwen3-32B_10episodes_comparisons_full_comparison_pairs.jsonl', 'r') as f:
for line in f:
pairs.append(json.loads(line))Format
Each comparison pair contains:
instance_id: SWE-bench problem identifiercorrect_response: Label ("A" or "B") indicating which response is correctpair_type: Type of comparison pair ("resolved" or "unresolved")episode_a,episode_b: Episode numbers for responses A and Btext_a,text_b: Model response text for responses A and Bfull_output_a,full_output_b: Full model output for responses A and Bmodel_patch_a,model_patch_b: Model-generated patches for responses A and Bresolved_a,resolved_b: Resolution status (True/False) for responses A and Bnum_passed_tests_a,num_passed_tests_b: Number of passed tests for responses A and Bmodel_name: Name of the model usednum_episodes_used: Number of episodes used in dataset creationsuccess_episode,failure_episode: Which episodes contained the successful and failed responses (for resolved pairs)better_episode,worse_episode: Which episodes contained the better and worse responses (for unresolved pairs)
Generated using createcomparisondataset.py
