rghosh8/gsm8k-deepseek-r1-distill-qwen-1.5b-rajat-seed-42-G-16
021
gsm8k-deepseek-r1-distill-qwen-1.5b-rajat-seed-42-G-16
LoRA adapter fine-tuned from deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B on GSM8K using GRPO.
Usage
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("rghosh8/gsm8k-deepseek-r1-distill-qwen-1.5b-rajat-seed-42-G-16", torch_dtype="auto", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("rghosh8/gsm8k-deepseek-r1-distill-qwen-1.5b-rajat-seed-42-G-16")