datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
text-code-galeras-code-generation-from-docstring-3k-dedupedai-code-generation-swe-agents-2026
💻 AI Code Generation, SWE Agents & Program Synthesis Dataset (2026 Edition)
A structured research dataset featuring 3,181 domain-verified research papers and 771 official code repositories focused on Autonomous Software Engineering Agents (SWE-bench), Program Synthesis, DeepSeek-Coder-V2, Qwen2.5-Coder, Test-Driven Code Repair, Self-Healing Software, AST Semantic Modeling, and Formal Logic Verification (2023–2026).
Built with Universal Scientific Engine V17.1 Gold, providing 47… See the full description on the dataset page: https://huggingface.co/datasets/beatsprom/ai-code-generation-swe-agents-2026.Code-Generation-Quality-Estimation
Code Generation Quality Estimation
This repository contains model-ready task context, generated code, and complete-case execution-resource targets for five public LLM code-generation cohorts. It provides deterministic 70/10/20 group-aware split versions using seeds 42, 1234, and 2026.
Configurations
There are 15 configurations: one for each dataset and split seed. Each configuration has train, validation, and test splits.
Dataset
Complete rows
Groups
Models… See the full description on the dataset page: https://huggingface.co/datasets/Samsoup/Code-Generation-Quality-Estimation.code-text-galeras-commit-generation-3k-dedupedunit_test_generation⚠️ Note: The dataset symprompt_supp.jsonl is not created by us. We only supplemented this dataset with additional branch-level metadata (e.g., has_branch, total_branches) to enable coverage testing.
This helps users keep their workflows clean when determining whether branches exist, simplifying branch coverage calculation.
It originates from the paper:
Code-Aware Prompting: A Study of Coverage Guided Test Generation in Regression Setting using LLM
— Gabriel Ryan, Siddhartha Jain, Mingyue… See the full description on the dataset page: https://huggingface.co/datasets/Code-TREAT/unit_test_generation.sft_trajectories_codegeneration_20250812_195018sft_trajectories_codegeneration_20250811_111740_filteredeval_metrics_5000_generations_test_text2struc_text_code_cif_1116sft_trajectories_codegeneration_20250812_030528_filteredeval_metrics_5000_generations_test_text2struc_text_code_1116results_on_code_generation_qwen3-14B-base_float32eval_metrics_5000_generations_test_text2struc_text_code_cif_1116sft_trajectories_codegeneration_20250804_211806sft_trajectories_codegeneration_20250806_001339code_generation
Visualization of Code Generation Task Cases Samples
Check dataset samples visualization by viewing Dataset Viewer.
The sampling procedure is guided by the Elo distribution introduced in our method.
Original dataset is release_v5 of livecodebench/code_generation_lite from hugging face.
samples/origin: 879/880
License
This repository is licensed under the Apache License 2.0
sft_trajectories_codegeneration_20250811_003619sft_trajectories_codegeneration_20250811_003619_filteredsft_trajectories_codegeneration_20250812_044453sft_trajectories_codegeneration_20250811_111740sft_trajectories_codegeneration_20250812_030528sft_trajectories_codegeneration_20250812_044453_filteredsft_trajectories_codegeneration_20250804_173314sft_trajectories_codegeneration_20250804_173456sft_trajectories_codegeneration_20250806_212151eval_metrics_5000_generations_test_text2struc_text_code_1116FEEDBACK_BASED_SOURCE_CODE_GENERATION
