CoolFace
Modelpublic

Yvthyvq/Liujgoj-Cantonese-gemma-4-12B-it-sft

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes13downloads
Model Card

Liujgoj-Cantonese-gemma-4-12B-it-sft

🌟 模型簡介

本模型係基於 `Yvthyvq/Liujgoj-Cantonese-gemma-4-12B-it-cpt` 進行 SFT (Supervised Fine-Tuning) 嘅粵語羅馬字對話模型。

透過 CPT + SFT 兩階段訓練,我哋成功將 Gemma 4 12B 打造成一個能夠 聽懂粵語指令、理解羅馬字、進行多任務對話 嘅粵語 AI 助手。

🎯 模型特點

  • —✅ 兩階段訓練:CPT(持續預訓練)+ SFT(監督微調)
  • —✅ 擴充詞表:新增 5,984 個粵語音節 Token + 16 個特殊標籤
  • —✅ 多任務能力:支援翻譯、解釋、對話、生成等多種任務
  • —✅ 粵語羅馬字:能夠流暢處理同生成 Jyutping(粵拼)
  • —✅ 對話優化:基於 Gemma 4 對話模板,支援多輪對話
  • —✅ 開箱即用:下載後即可進行粵語互動

🏷️ 特殊標籤列表

標籤用途
<ipa-lexicon_BLOCK> </ipa-lexicon_BLOCK>IPA 詞條區塊
<ipa-syllable_BLOCK> </ipa-syllable_BLOCK>IPA 音節區塊
<lexicon-ipa_BLOCK> </lexicon-ipa_BLOCK>詞條轉 IPA 區塊
<lexicon-syllable_BLOCK> </lexicon-syllable_BLOCK>詞條轉音節區塊
<syllable-ipa_BLOCK> </syllable-ipa_BLOCK>音節轉 IPA 區塊
<syllable-lexicon_BLOCK> </syllable-lexicon_BLOCK>音節轉詞條區塊
<SCENE> </SCENE>對話場景區塊
<LEX_BLOCK> </LEX_BLOCK>詞條解釋區塊

🚀 使用方法

基本載入

python
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch

model_path = "Yvthyvq/Liujgoj-Cantonese-gemma-4-12B-it-sft"

tokenizer = AutoTokenizer.from_pretrained(model_path)
model = AutoModelForCausalLM.from_pretrained(
    model_path,
    torch_dtype=torch.bfloat16,
    device_map="auto"
)

---

## 數據格式
所有數據採用統一的 messages 格式:

json
{
  "messages": [
    {"role": "user", "content": "..."},
    {"role": "assistant", "content": "..."}
  ]
}

---

🙏 致謝
Google 團隊開發並開源 Gemma 系列模型

Hugging Face 提供 Transformers 同 PEFT 框架

所有粵語數據貢獻者