Yvthyvq/Liujgoj-Cantonese-gemma-4-12B-it-sft
013
Liujgoj-Cantonese-gemma-4-12B-it-sft
🌟 模型簡介
本模型係基於 `Yvthyvq/Liujgoj-Cantonese-gemma-4-12B-it-cpt` 進行 SFT (Supervised Fine-Tuning) 嘅粵語羅馬字對話模型。
透過 CPT + SFT 兩階段訓練,我哋成功將 Gemma 4 12B 打造成一個能夠 聽懂粵語指令、理解羅馬字、進行多任務對話 嘅粵語 AI 助手。
🎯 模型特點
- ✅ 兩階段訓練:CPT(持續預訓練)+ SFT(監督微調)
- ✅ 擴充詞表:新增 5,984 個粵語音節 Token + 16 個特殊標籤
- ✅ 多任務能力:支援翻譯、解釋、對話、生成等多種任務
- ✅ 粵語羅馬字:能夠流暢處理同生成 Jyutping(粵拼)
- ✅ 對話優化:基於 Gemma 4 對話模板,支援多輪對話
- ✅ 開箱即用:下載後即可進行粵語互動
🏷️ 特殊標籤列表
🚀 使用方法
基本載入
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch
model_path = "Yvthyvq/Liujgoj-Cantonese-gemma-4-12B-it-sft"
tokenizer = AutoTokenizer.from_pretrained(model_path)
model = AutoModelForCausalLM.from_pretrained(
model_path,
torch_dtype=torch.bfloat16,
device_map="auto"
)
---
## 數據格式
所有數據採用統一的 messages 格式:
json
{
"messages": [
{"role": "user", "content": "..."},
{"role": "assistant", "content": "..."}
]
}
---
🙏 致謝
Google 團隊開發並開源 Gemma 系列模型
Hugging Face 提供 Transformers 同 PEFT 框架
所有粵語數據貢獻者