kenhktsui/Qwen2.5-3B-Instruct-GRPO-minp-sampling_temp_05
014
Upload model trained with Unsloth
Trained with Unsloth
Upload tokenizer
Upload README.md with huggingface_hub
initial commit
Upload model trained with Unsloth
Trained with Unsloth
Upload tokenizer
Upload README.md with huggingface_hub
initial commit