models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
UnifiedReward-Think-rejection_sampling_wholeqwen_2.5_7b-rejection_sampling-2.4k-think_tag-Qwen2.5-1.5B-Instruct-lr1e-05-liger_True-ckpt302qwen_2.5_7b-rejection_sampling-2.4k-think_tag-Qwen2.5-1.5B-Instruct-lr5e-05-liger_True-ckpt302qwen_2.5_7b-rejection_sampling-2.4k-think_tag-Qwen2.5-1.5B-Instruct-lr2e-06-liger_True-ckpt302qwen_2.5_7b-rejection_sampling-2.4k-think_tag-Qwen2.5-7B-Instruct-lr5e-06-liger_True-ckpt302qwen_2.5_7b-rejection_sampling-2.4k-think_tag-Qwen2.5-7B-Instruct-lr1e-06-liger_True-ckpt302qwen_2.5_7b-rejection_sampling-2.4k-think_tag-Qwen2.5-3B-Instruct-lr1e-05-liger_True-ckpt302Llama-2-7b-chat-hf-science-rejection-samplingqwen_2.5_7b-rejection_sampling-2.4k-think_tag-Qwen2.5-7B-Instruct-lr1e-05-liger_True-ckpt302qwen_2.5_7b-rejection_sampling-2.4k-think_tag-Qwen2.5-7B-Instruct-lr2e-06-liger_True-ckpt302qwen_2.5_7b-rejection_sampling-2.4k-think_tag-Qwen2.5-3B-Instruct-lr5e-05-liger_True-ckpt302qwen_2.5_7b-rejection_sampling-2.4k-think_tag-Qwen2.5-3B-Instruct-lr2e-06-liger_True-ckpt302Qwen2.5-1.5B-RejectionSampling-CodeLinkQwen2.5-1.5B-Instruct_rejection_sampling_MATH_training_short_CoTsft_rejection_sampling_pgb_clin_herg_Intern-s1-mini-distill-dsv32-11k-samples_lr1e-05
