CoolFace
Modelpublic

DavidLanz/embeddinggemma-GTAIDE-300m-2605-GGUF

sourceHugging Faceotherupdated 2mo agoView on Hugging Face
1likes178downloads
Model Card

embeddinggemma-GTAIDE-300m-2605 GGUF

這是 TAIDE 的 embeddinggemma-GTAIDE-300m-2605 的 GGUF 轉換與量化版本,可用最新版 llama.cpp 執行。

模型以 Google EmbeddingGemma 300M 為基礎,經正體中文法規資料微調。最大序列長度為 2,048 tokens,輸出為 768 維向量,採 cosine similarity。

檔案

檔名格式大小建議用途
embeddinggemma-GTAIDE-300m-2605-BF16.ggufBF16600.88 MiB基準品質、驗證
embeddinggemma-GTAIDE-300m-2605-Q8_0.ggufQ8_0325.96 MiB推薦;品質與大小平衡
embeddinggemma-GTAIDE-300m-2605-Q4_K_M.ggufQ4KM235.74 MiB記憶體較受限的環境

完整 SHA-256 位於 SHA256SUMS,轉換來源與驗證資料位於 conversion-manifest.json。

llama.cpp 使用方式

啟動 OpenAI 相容 embeddings API:

bash
llama-server \
  --model embeddinggemma-GTAIDE-300m-2605-Q8_0.gguf \
  --alias embeddinggemma-GTAIDE-300m-2605 \
  --embeddings \
  --pooling mean \
  --ctx-size 2048 \
  --host 127.0.0.1 \
  --port 8080

送出查詢與文件:

bash
curl http://127.0.0.1:8080/v1/embeddings \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "embeddinggemma-GTAIDE-300m-2605",
    "input": [
      "task: search result | query: 勞工保險費如何繳納?",
      "title: none | text: 投保單位應於次月底前繳納保險費。"
    ]
  }'

檢索時請由呼叫端加入 EmbeddingGemma 的 task prompt:

類型格式
Query`task: search result \query: {query}`
Document`title: none \text: {document}`

原始 TAIDE 模型卡的示例是對 query 使用 model.encode(query)、對文件使用 model.encode_document(docs)。若要精確重現該示例,query 不加前綴,文件仍使用 title: none | text: 前綴。

轉換資訊

  • —來源模型 revision:451ef76c7ef163f8c08903f196b78f85e0b4a027
  • —llama.cpp commit:6ba5ef247034cd57201360aed246d98f5a404d92
  • —轉換日期:2026-07-28
  • —架構:gemma-embedding
  • —Pooling:mean
  • —上下文長度:2,048
  • —輸出維度:768
  • —GGUF 張量數:316

BF16 轉換保留 Sentence Transformers 的 2_Dense 與 3_Dense 投影層:

bash
python convert_hf_to_gguf.py MODEL_DIR \
  --outfile embeddinggemma-GTAIDE-300m-2605-BF16.gguf \
  --outtype bf16 \
  --sentence-transformers-dense-modules \
  --model-name embeddinggemma-GTAIDE-300m-2605

量化指令:

bash
llama-quantize embeddinggemma-GTAIDE-300m-2605-BF16.gguf \
  embeddinggemma-GTAIDE-300m-2605-Q8_0.gguf Q8_0

llama-quantize embeddinggemma-GTAIDE-300m-2605-BF16.gguf \
  embeddinggemma-GTAIDE-300m-2605-Q4_K_M.gguf Q4_K_M

Tokenizer 相容性處理

來源的文字模型 embedding matrix 為 262,144 tokens(ID 0..262143),但 tokenizer 額外宣告了未被文字模型使用的 <image_soft_token>(ID 262144)。最新版 llama.cpp 轉換器會正確拒絕這個超出 embedding matrix 的 ID。

因此只在轉換用副本中移除該 image-only token,以及 tokenizer_config.json 對應的 image token 宣告;原始下載檔未修改。一般中英文測試文字在修正前後的 token IDs 完全相同。

驗證結果

以 sentence-transformers==5.3.0、transformers==5.3.0 的原始 F32 模型作為參考,對六組中英文與檢索 prompt 比較正規化後的 768 維向量:

GGUF與原始模型 cosine 平均值最低值
BF160.9999880.999982
Q8_00.9996880.999496
Q4KM0.9871430.982265

另已驗證:

  • —三個 GGUF 都能由最新版 llama-embedding 載入並輸出 768 維向量。
  • —Q8_0 已通過 llama-server 的 /v1/embeddings 批次 API 測試。
  • —原始模型卡示例在相同 Python 套件版本下得到 [0.697366, 0.289298, 0.202309],與模型卡公布的 [0.6974, 0.2893, 0.2023] 一致。

授權

此轉換不變更原始模型授權。下載、散布或使用前,請閱讀並遵守 TAIDE 原始模型頁面 所列的 Gemma 版次 TAIDE 模型授權條款與相關要求。