CoolFace
Modelpublic

xCloudinfo/Llama-xReadable-11B-zhTW-OCR-v1

sourceHugging Facellama3.2updated 3mo agoView on Hugging Face
0likes6downloads
Model Card

Llama-xReadable-11B-zhTW-OCR-v1

Built with Llama

云碩科技 · xCloudinfo · 系列:Meta Llama 3.2 Vision · 云碩繁體中文 OCR

以 `meta-llama/Llama-3.2-11B-Vision-Instruct` 為基底,由云碩科技在自有 AI 算力資源池上微調的繁體中文(台灣)OCR 模型。專注台灣場景的文字辨識——公文、票據、機房與售前筆記等中英混寫內容,可地端部署、資料不外流。xReadable:讓文件被讀懂。

定位:印刷/掃描文件辨識已達可用水準;手寫辨識為實驗性預覽(experimental preview),持續迭代中。

能力與量測(真實資料、逐字 CER)

評測皆以真實拍攝/掃描影像計算字元錯誤率(CER,越低越好),非合成樣本。

場景CER說明
印刷/掃描繁中文件(真實照片 120 張)0.93%可用水準
手寫繁中筆記(真實照片,短篇業務筆記)64.1%(4 張)experimental preview,尚未達生產可用
手寫繁中筆記(長篇多句內容)142.2%(16 張)experimental preview,長文本仍會出現內容幻覺
  • —印刷體是本模型目前的主力能力,對台灣公文/票據/規格文件的中英混寫辨識穩定、CER 已在 1% 以下。
  • —手寫體難度顯著更高(台灣繁中手寫本身是資料稀缺領域),且短篇與長篇表現落差大——短篇業務筆記約六成字元有誤,長篇內容更易產生語法通順但內容錯誤的幻覺。實測中,本模型在真實手寫上已優於通用視覺語言模型(同基準下,通用視覺語言模型在真實手寫上大量幻覺、CER 超過 100%),但距離生產可用仍有距離,屬公開預覽性質,重要用途請務必人工複核,歡迎回饋。

用途與限制

  • —適用:台灣繁中印刷/掃描文件的地端 OCR、文件數位化、票據與筆記辨識前處理。
  • —限制:
  • —手寫辨識為實驗性,複雜潦草字跡仍可能出錯或產生幻覺,重要用途請人工複核。
  • —純英文長段落尚未系統性驗證。
  • —表格/版面複雜文件建議先切行/切格再辨識。
  • —本模型輸出僅供辨識參考,不宜作為法律、醫療、財務等關鍵決策的唯一依據。

格式與相容性

本 repo 目前僅提供 bf16 safetensors(transformers 原生格式),尚未提供 GGUF 量化版本。

  • —原因:Llama 3.2 Vision 使用的 mllama 架構,llama.cpp 官方目前不支援轉換或載入(上游 issue 自 2024-09 未解決)。這代表 llama.cpp / llama-server / LM Studio / GPT4All 等以 llama.cpp 為底層的工具目前都無法運行本模型(市面上少數自稱支援的 mllama GGUF 是用 Ollama 私有 fork 轉出,僅能在該環境下運作,與標準 llama.cpp 生態不相容)。上游一旦支援,本 repo 會補上官方相容的 GGUF 版本。
  • —可用方式:transformers(Python)與 vLLM 皆原生支援 mllama 架構,可直接載入本模型。

硬體需求

bf16 權重約 21GB,建議:

  • —推論:單張 ≥ 24GB VRAM 的 GPU(如 RTX 3090/4090、A10、L4、A100 等)可完整載入;記憶體不足可用 device_map="auto" 搭配多卡分攤,或自行做 int8/int4 量化(bitsandbytes)降低需求。
  • —純 CPU 推論理論可行但速度不實用,不建議。

用法 1:transformers

python
from transformers import MllamaForConditionalGeneration, AutoProcessor
from PIL import Image
import torch

model_id = "xCloudinfo/Llama-xReadable-11B-zhTW-OCR-v1"
model = MllamaForConditionalGeneration.from_pretrained(
    model_id, torch_dtype=torch.bfloat16, device_map="auto"
).eval()
processor = AutoProcessor.from_pretrained(model_id)

image = Image.open("your_document.jpg").convert("RGB")
prompt = "請辨識圖片中的所有文字,逐字完整輸出,只輸出文字本身。"
messages = [{"role": "user", "content": [{"type": "image"}, {"type": "text", "text": prompt}]}]
text = processor.apply_chat_template(messages, add_generation_prompt=True, tokenize=False)
inputs = processor(text=[text], images=[image], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=768, do_sample=False)
print(processor.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))

用法 2:vLLM(推薦用於伺服器部署/高吞吐)

bash
vllm serve xCloudinfo/Llama-xReadable-11B-zhTW-OCR-v1 \
    --dtype bfloat16 \
    --max-model-len 4096

啟動後以 OpenAI 相容 API(圖片以 image_url 傳入 messages)呼叫即可。

授權與來源聲明(Llama 3.2 Community License)

本模型為 Meta Llama 3.2 的衍生模型,散布須遵守 Llama 3.2 Community License Agreement。以下依該授權條款聲明:

  • —Built with Llama。 本模型以 Meta Llama 3.2 建構。
  • —基底模型:`meta-llama/Llama-3.2-11B-Vision-Instruct`(Meta Platforms, Inc.)。Llama 3.2 為 Meta 之財產,Llama Materials 之權利與所有權屬 Meta。
  • —模型命名:依 Llama 3.2 授權要求,衍生模型名稱以「Llama」開頭(本模型:Llama-xReadable-11B-zhTW-OCR-v1)。
  • —授權文本:本散布隨附 Llama 3.2 Community License Agreement 副本(見本 repo LICENSE 檔);使用、重製、散布本模型或其衍生物,須提供該授權副本並保留本聲明。
  • —可接受使用政策:使用須遵守 Meta Acceptable Use Policy。
  • —歐盟(EU)限制:Llama 3.2 授權規定,設立地或主要營業地在歐盟的個人或公司,不被授予使用 Llama 3.2 多模態模型所含之多模態能力的授權。歐盟主體請勿將本模型用於該等用途。
  • —大規模服務門檻:若在 Llama 3.2 發布日,貴方(或關係企業)提供之產品/服務前一曆月的月活躍使用者超過 7 億,須另向 Meta 申請授權。
  • —微調與散布由 云碩科技 xCloudinfo 進行;不得用於非法用途;須遵守中華民國相關法律。

Built with Llama. 由 云碩科技 xCloudinfo 於自有 AI 算力資源池微調、散布;基底模型之權利屬 Meta Platforms, Inc.。