Itaking/itakura-300m-pretrain-cpt-sft-dpo-model
08
OLMo-2 300M — DPO (Final Model)
OLMo-2 ~300M のフルパイプライン最終モデルです。 Pretrain → CPT → SFT → DPO の 4 ステージを経て alignment 済み。
Model Architecture
Training Pipeline
DPO Training Details
Usage
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch
model_id = "your_username/olmo2-300m-dpo"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype=torch.bfloat16, device_map="auto")
messages = [{"role": "user", "content": "機械学習を初心者向けに説明してください。"}]
input_text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer(input_text, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=300, temperature=0.7, do_sample=True)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))Intended Use
- 英日バイリンガルの質問応答・対話
- LLM フルパイプライン(Pretrain → DPO)の研究・学習目的
Limitations
- モデルサイズが小さく(~300M)、大規模モデルと比較して品質は限定的
- 事実の正確性を保証しない
- 有害コンテンツの完全な排除は保証されない
Training Data Attribution
License
Apache 2.0
