datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
SWE-Lego-Real-Data-Verified
SWE-Lego-Real-Data-Verified
Gold-patch-validated subset of
PrimeIntellect/SWE-Lego-Real-Data
(itself a fixed fork of SWE-Lego's real-data split). The
resolved split contains 4,323 / 4,432 rows (97.54%) verified scoreable end-to-end: apply
test_patch, apply the gold patch, run the row's test_cmd in its image, require every
F2P/P2P test to report PASSED.
Changes vs upstream
Validation-only subset — our passes: one full pass at concurrency 200, then a 10× retry… See the full description on the dataset page: https://huggingface.co/datasets/PrimeIntellect/SWE-Lego-Real-Data-Verified.IF_sft_data_verifiedswebench_verified_random_100_folders_nemotron_terminal_data_querying__Qwen3_8B_3862faf0agentic_dataset_r2e_swe_verifiedswebench_verified_random_100_folders_nemotron_terminal_data_science__Qwen3_8B_2d0a84af2swebench_verified_random_100_folders_nemotron_terminal_data_processing__Qwen3_87dd0272eIF_sft_data_verified-with-olmo-system-promptverified-q-alignment-dynamic-preference-dataPAD3-Dataset-Revisi_verifiedverified-data-manimverified-qfa-data-initialverified-q-alignment-initial-datasetIF_sft_data_verified_permissive_decontam_v2IF_sft_data_verified_permissive_decontam_v2_filteredif-sft-data-verified-permissive-unused-gemma3verified-q-alignment-initial-dataset-cur-scoredarwin_iter2_dataset_verified_matchedservice-tipping-reddit-data-verifiedverified-q-alignment-dynamic-preference-data-cur-scoreif-sft-data-verified-permissive-unused-qwqverified-5-class-lead-dataset-2024verified-data-RLHF
