CoolFace
Modelpublic

Itaking/itakura-300m-pretrain-cpt-sft-dpo-model

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes8downloads
Model Card

OLMo-2 300M — DPO (Final Model)

OLMo-2 ~300M のフルパイプライン最終モデルです。 Pretrain → CPT → SFT → DPO の 4 ステージを経て alignment 済み。

Model Architecture

項目値
Base configallenai/OLMo-2-0425-1B(config のみ・重みは使用せず)
Parameters~300M
hidden_size1024
numhiddenlayers16
numattentionheads16
numkeyvalue_heads8 (GQA)
intermediate_size4096
Tokenizerallenai/OLMo-2-0425-1B

Training Pipeline

Stageモデルデータ概要
1. Pretrainランダム初期化FineWeb ~1.5B tokens大規模コーパスで言語モデリング
2. CPTStage 1 出力FineWeb-Edu + Wikipedia JA ~0.3B tokens英日バイリンガル継続学習
3. SFTStage 2 出力Tülu-3 SFT mixture 100K samples指示追従の習得
4. DPO(このモデル)Stage 3 出力UltraFeedback binarized人間の好みに合わせた alignment

DPO Training Details

項目値
Datasetallenai/ultrafeedbackbinarizedcleaned
LossDPO (β=0.1)
Learning rate5e-7 (linear decay)
Warmup ratio0.1
Epochs1
HardwareNVIDIA RTX 4090 24GB
FrameworkTRL DPOTrainer

Usage

python
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch

model_id = "your_username/olmo2-300m-dpo"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype=torch.bfloat16, device_map="auto")

messages = [{"role": "user", "content": "機械学習を初心者向けに説明してください。"}]
input_text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer(input_text, return_tensors="pt").to(model.device)

outputs = model.generate(**inputs, max_new_tokens=300, temperature=0.7, do_sample=True)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))

Intended Use

  • —英日バイリンガルの質問応答・対話
  • —LLM フルパイプライン(Pretrain → DPO)の研究・学習目的

Limitations

  • —モデルサイズが小さく(~300M)、大規模モデルと比較して品質は限定的
  • —事実の正確性を保証しない
  • —有害コンテンツの完全な排除は保証されない

Training Data Attribution

データセットライセンス
FineWeb-Edu (HuggingFaceFW)ODC-By
Wikipedia JA (Wikimedia)CC BY-SA 4.0
Tülu-3 SFT mixture (AllenAI)混合
UltraFeedback binarized (AllenAI)MIT

License

Apache 2.0