CoolFace
Modelpublic

rghosh8/gsm8k-deepseek-r1-distill-qwen-1.5b-rajat-seed-42-G-16

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes21downloads
Model Card

gsm8k-deepseek-r1-distill-qwen-1.5b-rajat-seed-42-G-16

LoRA adapter fine-tuned from deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B on GSM8K using GRPO.

Usage

python
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained("rghosh8/gsm8k-deepseek-r1-distill-qwen-1.5b-rajat-seed-42-G-16", torch_dtype="auto", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("rghosh8/gsm8k-deepseek-r1-distill-qwen-1.5b-rajat-seed-42-G-16")