datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
QwQ-Long-CoT-30k-subset-Llama3.1-8B-dynamic-perturbation-regex-generation-max-marginQwQ-Long-CoT-10k-subset-Llama3.1-8B-single-position-regex-perturbationQwQ-Long-CoT-15k-subset-Llama3.1-8B-single-position-regex-perturbations-logps-15QwQ-Long-CoT-10k-subset-Llama3.1-8B-dynamic-perturbation-regex-generation-max-margin-10QwQ-Long-CoT-10k-subset-llama3.1-8b-Inst-GPT4-Step-Perturbation-8-rejectsQwQ-Long-CoT-30k-subset-Llama3.1-8B-dynamic-perturbation-regex-generation-max-margin-logp-10QwQ-Long-CoT-10k-subset-Llama3.1-8B-Instruct-on-policy-alignment-pertubation-generation-fullQwQ-Long-CoT-10k-subset-Llama3.1-8B-single-position-regex-perturbations-logps-10QwQ-Long-CoT-10k-subset-Llama3.1-8B-dynamic-perturbation-augmented-3-regex-generation-max-marginQwQ-Long-CoT-10k-subset-Qwen2.5-7B-Instruct-on-policy-alignment-pertubation-generationQwQ-Long-CoT-10k-subset-Llama3.1-8B-dynamic-perturbation-regex-generation-max-margin-top-k-2QwQ-Long-CoT-10k-subset-Qwen2.5-7B-Instruct-model-pertubation-generationQwQ-Long-CoT-10k-subset-Llama3.1-8B-dynamic-perturbation-regex-generation-max-marginFiltered-QwQ-Long-CoT-10k-subset-Llama3.1-8B-Instruct-model-pertubation-generation-maskedopenthoughts-math-long-cot-completeQwQ-Long-CoT-10k-subset-Llama3.1-8B-Instruct-pertubation-generation-logpsFiltered-QwQ-Long-CoT-10k-subset-Llama3.1-8B-Instruct-training-dataFiltered-QwQ-Long-CoT-10k-subset-Llama3.1-8B-Instruct-training-data-Step-MPOQwQ-Long-CoT-10k-subset-Llama3.1-8B-dynamic-perturbation-augmented-regex-generation-max-marginQwQ-Long-CoT-10k-subset-Llama3.1-8B-Instruct-on-policy-alignment-pertubation-generationFiltered-QwQ-Long-CoT-10k-subset-Llama3.1-model-pertubation-generation-masked-logp30Filtered-QwQ-Long-CoT-10k-subset-Llama3.1-8B-Instruct-model-pertubation-generation-logps-10Filtered-QwQ-Long-CoT-10k-subset-Llama3.1-8B-Instruct-model-pertubation-generation-masked-newQwQ-Long-CoT-10k-subset-Llama3.1-8B-dynamic-perturbation-regex-generation-max-margin-completeFiltered-QwQ-Long-CoT-10k-subset-Llama3.1-8B-Instruct-on-policy-alignment-pertubation-generationFiltered-QwQ-Long-CoT-10k-subset-Llama3.1-8B-Instruct-pertubation-generation-logpsFiltered-QwQ-Long-CoT-10k-subset-Llama3.1-8B-Instruct-pertubation-generation-maskedQwQ-Long-CoT-10k-subset-Llama3.1-8B-Instruct-model-dynamic-perturbation-generationQwQ-Long-CoT-10k-subset-Llama3.1-8B-regex-perturbation-generationFiltered-QwQ-Long-CoT-10k-subset-Llama3.1-8B-Instruct-training-data-iteration2
