CoolFace
Modelpublic

gyung/lfm2-1.2b-koen-mt-v8-rl-10k-adapter

sourceHugging Faceotherupdated 9mo agoView on Hugging Face
2likes17downloads
Model Card

๐Ÿ† LFM2-v8-RL-10k Adapter (SOTA)

GRPO + COMET/CHrF++ ๊ฐ•ํ™”ํ•™์Šต์œผ๋กœ ํ›ˆ๋ จ๋œ ํ•œ์˜/์˜ํ•œ ์–‘๋ฐฉํ–ฅ ๋ฒˆ์—ญ LoRA Adapter

โš ๏ธ ์ด Adapter๋Š” ๋ฐ˜๋“œ์‹œ Base ๋ชจ๋ธ๊ณผ ํ•จ๊ป˜ ์‚ฌ์šฉํ•ด์•ผ ํ•ฉ๋‹ˆ๋‹ค! Base Model: gyung/lfm2-1.2b-koen-mt-v6.4-merged

๐Ÿ… ํ•ต์‹ฌ ์„ฑ๊ณผ

  • โ€”1.2B ๋ชจ๋ธ์ด 4B ๋ชจ๋ธ์„ ์••๋„! Gemma-3 (4B)๋ณด๋‹ค 1.78 CHrF++ ๋†’์Œ
  • โ€”๋‹จ 400 Step (0.78 Epoch)๋งŒ์˜ ํ•™์Šต์œผ๋กœ SOTA ๋‹ฌ์„ฑ
  • โ€”์กด๋Œ“๋ง ์ผ๊ด€์„ฑ ์™„๋ฒฝ: 1012๊ฐœ ์ƒ˜ํ”Œ ์ „์ฒด์—์„œ "~ํ•ฉ๋‹ˆ๋‹ค" ์–ด๋ฏธ ์ผ๊ด€ ์ ์šฉ
  • โ€”Google Colab T4 ๋ฌด๋ฃŒ GPU๋กœ ํ•™์Šต ๊ฐ€๋Šฅ

๐Ÿ“Š ์„ฑ๋Šฅ (Flores-200 Benchmark, 1012 Samples)

RankModelCHrF++BLEUParams
1Google Translate39.2718.18- (API)
2๐Ÿ† LFM2-v8-RL (Step 400)34.6113.211.2B
3Gemma-3-4B-it-GGUF32.8311.364B
4LFM2-1.2B (Base)27.236.431.2B
5Qwen3-4B-GGUF (Base)25.62-4B

โœ… 1.2B ๋ชจ๋ธ๋กœ 4B ๋ชจ๋ธ๋“ค์„ ์••๋„์ ์œผ๋กœ ๋Šฅ๊ฐ€!

๐Ÿ“ˆ ํ•™์Šต ๊ณผ์ •๋ณ„ ์„ฑ๋Šฅ ํ–ฅ์ƒ

StepEpochCHrF++BLEU๋น„๊ณ 
00.0033.5312.63v6.4 Base
2000.3934.1012.93+0.57 ํ–ฅ์ƒ
3000.5934.1913.24Historic High
4000.7834.6113.21๐Ÿ† SOTA

โœจ v8์˜ ๊ฐ•์ 

  1. 1.์กด๋Œ“๋ง/๋ฌธ์ฒด ์ผ๊ด€์„ฑ: "~ํ•ฉ๋‹ˆ๋‹ค", "~ํ–ˆ์Šต๋‹ˆ๋‹ค" ์–ด๋ฏธ๊ฐ€ ์ „ ์ƒ˜ํ”Œ์— ๊ฑธ์ณ ์ผ๊ด€๋˜๊ฒŒ ์ ์šฉ
  2. 2.์ž์—ฐ์Šค๋Ÿฌ์šด ๋ฌธ์žฅ ๊ตฌ์กฐ: "ํƒ€์Šค๋งˆ๋‹ˆ์•„ ์ฃผ ๋ฐ๋ณธํฌํŠธ์˜ ๋ฉ”์ด๋ฒ„ ๋ณ‘์› ์ž๊ธˆ์„..." ๊ฐ™์€ ๋ณต์žกํ•œ ๋ฌธ์žฅ๋„ ์ž์—ฐ์Šค๋Ÿฝ๊ฒŒ ์ฒ˜๋ฆฌ
  3. 3.๋ฌธ๋งฅ ์ธ์‹ ๋ฒˆ์—ญ: "While"์„ ๋ฌธ๋งฅ์— ๋”ฐ๋ผ "๋ฐ˜๋ฉด", "๋™์•ˆ" ๋“ฑ์œผ๋กœ ์œ ์—ฐํ•˜๊ฒŒ ๋ฒˆ์—ญ
  4. 4.์ „๋ฌธ ์šฉ์–ด ์ฒ˜๋ฆฌ: "rachis"๋ฅผ "์šฐ์ถ•"์œผ๋กœ ์ •ํ™•ํ•˜๊ฒŒ ๋ฒˆ์—ญ

โš ๏ธ ์•Œ๋ ค์ง„ ํ•œ๊ณ„

  1. 1.๊ณ ์œ ๋ช…์‚ฌ ํ™˜๊ฐ: "George W. Bush" โ†’ "์กฐ์ง€ ์›Œ์‹ฑํ„ด"์œผ๋กœ ์ž˜๋ชป ๋ฒˆ์—ญ (๋ฒ ์ด์Šค ๋ชจ๋ธ์—์„œ ์ƒ์†๋œ ํŽธํ–ฅ)
  2. 2.์ผ๋ถ€ ์ „๋ฌธ ์šฉ์–ด ์˜ค์—ญ: ํŠน์ • ๊ณผํ•™ ์šฉ์–ด์—์„œ ์˜ค๋ฅ˜ ๋ฐœ์ƒ ๊ฐ€๋Šฅ
๐Ÿ’ก ํ•ด๊ฒฐ ๋ฐฉ์•ˆ: DPO๋ฅผ ํ†ตํ•œ ํ™˜๊ฐ ๊ต์ • ์˜ˆ์ • (v9)

๐Ÿ”ง ์‚ฌ์šฉ๋ฒ•

1. Adapter ๋กœ๋“œ (์ถ”์ฒœ)

python
from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel

# Base ๋ชจ๋ธ ๋กœ๋“œ
base_model = AutoModelForCausalLM.from_pretrained(
    "gyung/lfm2-1.2b-koen-mt-v6.4-merged",
    device_map="auto",
    torch_dtype="auto"
)
tokenizer = AutoTokenizer.from_pretrained("gyung/lfm2-1.2b-koen-mt-v6.4-merged")

# Adapter ๋กœ๋“œ ๋ฐ ๋ณ‘ํ•ฉ
model = PeftModel.from_pretrained(base_model, "gyung/lfm2-1.2b-koen-mt-v8-rl-10k-adapter")
model = model.merge_and_unload()  # ์ถ”๋ก  ์†๋„ ํ–ฅ์ƒ

2. ๋ฒˆ์—ญ ์‹คํ–‰

python
# ์˜์–ด โ†’ ํ•œ๊ตญ์–ด
messages = [
    {"role": "system", "content": "Translate to Korean."},
    {"role": "user", "content": "The quick brown fox jumps over the lazy dog."}
]

# ํ•œ๊ตญ์–ด โ†’ ์˜์–ด
messages = [
    {"role": "system", "content": "Translate to English."},
    {"role": "user", "content": "๋น ๋ฅธ ๊ฐˆ์ƒ‰ ์—ฌ์šฐ๊ฐ€ ๊ฒŒ์œผ๋ฅธ ๊ฐœ๋ฅผ ๋›ฐ์–ด๋„˜์Šต๋‹ˆ๋‹ค."}
]

input_ids = tokenizer.apply_chat_template(
    messages, return_tensors="pt", add_generation_prompt=True
).to(model.device)

outputs = model.generate(
    input_ids,
    max_new_tokens=256,
    do_sample=True,
    temperature=0.3,
    min_p=0.15,
    repetition_penalty=1.05
)

translation = tokenizer.decode(outputs[0][input_ids.shape[1]:], skip_special_tokens=True)
print(translation)

๐Ÿ“ˆ ํ•™์Šต ์ƒ์„ธ

ํ•ญ๋ชฉ๊ฐ’
Base Modelgyung/lfm2-1.2b-koen-mt-v6.4-merged
MethodGRPO (Group Relative Policy Optimization)
RewardCOMET + CHrF++
Dataset Size10,000 samples (์–‘๋ฐฉํ–ฅ)
Training Steps400
Effective Batch Size128
LoRA Rank32
LoRA Alpha64
Target Modulesall-linear

๐Ÿ”ง ํ•™์Šต ๋ฐฉ๋ฒ•๋ก 

"Data-Centric + Progressive Learning" ํŒŒ์ดํ”„๋ผ์ธ:

  1. 1.SFT (Step 1): LFM2-1.2B ๋ฒ ์ด์Šค โ†’ 20๋งŒ๊ฐœ + 8.8๋งŒ๊ฐœ ๊ณ ํ’ˆ์งˆ ๋ฒˆ์—ญ ๋ฐ์ดํ„ฐ ํ•™์Šต โ†’ v6.4
  2. 2.GRPO (Step 2): v6.4 โ†’ 10k ์–‘๋ฐฉํ–ฅ RL ๋ฐ์ดํ„ฐ + COMET/CHrF++ ๋ฆฌ์›Œ๋“œ โ†’ v8 (SOTA)
๐Ÿ’ก ํ•ต์‹ฌ: ๋ฌด์ž‘์ • ๋ฐ์ดํ„ฐ๋ฅผ ๋Š˜๋ฆฌ๋Š” ๊ฒŒ ์•„๋‹ˆ๋ผ, ์•ฝ์ ์„ ๋ถ„์„ํ•˜๊ณ  ํƒ€๊ฒŸํŒ…๋œ ๋ฐ์ดํ„ฐ๋ฅผ ์ถ”๊ฐ€

๐Ÿš€ ํ–ฅํ›„ ๊ณ„ํš

  1. 1.์ถ”๊ฐ€ RL ํ•™์Šต: 1,200+ Step๊นŒ์ง€ ํ•™์Šต ์˜ˆ์ • (ProRL ๋…ผ๋ฌธ ๊ถŒ์žฅ)
  2. 2.DPO๋กœ ํ™˜๊ฐ ์ˆ˜์ •: "George W. Bush" ๋“ฑ ๊ณ ์œ ๋ช…์‚ฌ ์˜ค์—ญ ๊ต์ •
  3. 3.DuPO ์ ์šฉ: ์—ญ๋ฒˆ์—ญ ๊ธฐ๋ฐ˜ ์ž๊ธฐ ๊ฒ€์ฆ (ByteDance ๋…ผ๋ฌธ)
  4. 4.LFM2-2.6B-Exp: ์ƒˆ๋กœ์šด ๋ฒ ์ด์Šค ๋ชจ๋ธ ๊ธฐ๋ฐ˜ ํ•™์Šต

๐Ÿ”— ๊ด€๋ จ ๋งํฌ

๐Ÿ“ Citation

bibtex
@misc{lfm2-koen-v8-rl,
  author = {gyung},
  title = {LFM2-1.2B-KoEn-MT-v8-RL: GRPO-Enhanced Bidirectional Korean-English Translation Adapter},
  year = {2024},
  publisher = {Hugging Face},
  url = {https://huggingface.co/gyung/lfm2-1.2b-koen-mt-v8-rl-10k-adapter}
}

๐Ÿ“„ License

This model inherits the LFM Open License v1.0 from the base LFM2 model.