xeker/deepseek-r1-32b-v2-awq
013
DeepSeek-R1-32B-v2 AWQ
DeepSeek-R1-Distill-Qwen-32B의 AWQ 4-bit 양자화 모델입니다. GPTQ 대비 추론 속도와 메모리 효율에서 장점을 가지며, 한국어 학술 지문 기반 수능 풀이 특화 프로젝트에서 활용되었습니다.
모델 정보
GPTQ 버전과 비교
사용 방법
from transformers import AutoTokenizer, AutoModelForCausalLM
tokenizer = AutoTokenizer.from_pretrained("xeker/deepseek-r1-32b-v2-awq")
model = AutoModelForCausalLM.from_pretrained(
"xeker/deepseek-r1-32b-v2-awq",
device_map="auto"
)
messages = [
{"role": "user", "content": "다음 문제를 단계적으로 풀어보세요.\n\n[문제]"}
]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer(text, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=4096)
print(tokenizer.decode(outputs[0], skip_special_tokens=False))vLLM 사용 (권장)
from vllm import LLM, SamplingParams
llm = LLM(model="xeker/deepseek-r1-32b-v2-awq", quantization="awq")
sampling_params = SamplingParams(temperature=0.7, max_tokens=4096)
outputs = llm.generate(["다음 문제를 풀어보세요."], sampling_params)
print(outputs[0].outputs[0].text)프로젝트 배경
네이버 부스트캠프 AI Tech 8기 팀 프로젝트의 일환으로 진행된 수능 풀이 특화 LLM 개발 프로젝트에서 활용된 모델입니다.
