hirosan6595/dpo-qwen-cot-merged-0216-1614
010
dpo-qwen-cot-merged-0216-1614
Qwen/Qwen3-4B-Instruct-2507 を SFT LoRA でファインチューニングした後、DPO(Direct Preference Optimization)でアライメントしたモデルです。
Training Details
Usage
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
model_id = "hirosan6595/dpo-qwen-cot-merged-0216-1614"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype=torch.float16,
device_map="auto",
)
messages = [{"role": "user", "content": "Your question here"}]
inputs = tokenizer.apply_chat_template(
messages,
tokenize=True,
add_generation_prompt=True,
return_tensors="pt",
).to(model.device)
outputs = model.generate(inputs, max_new_tokens=512, do_sample=False)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))