xCloudinfo/Llama-xReadable-11B-zhTW-OCR-v1
06
Llama-xReadable-11B-zhTW-OCR-v1
Built with Llama
云碩科技 · xCloudinfo · 系列:Meta Llama 3.2 Vision · 云碩繁體中文 OCR
以 `meta-llama/Llama-3.2-11B-Vision-Instruct` 為基底,由云碩科技在自有 AI 算力資源池上微調的繁體中文(台灣)OCR 模型。專注台灣場景的文字辨識——公文、票據、機房與售前筆記等中英混寫內容,可地端部署、資料不外流。xReadable:讓文件被讀懂。
定位:印刷/掃描文件辨識已達可用水準;手寫辨識為實驗性預覽(experimental preview),持續迭代中。
能力與量測(真實資料、逐字 CER)
評測皆以真實拍攝/掃描影像計算字元錯誤率(CER,越低越好),非合成樣本。
- 印刷體是本模型目前的主力能力,對台灣公文/票據/規格文件的中英混寫辨識穩定、CER 已在 1% 以下。
- 手寫體難度顯著更高(台灣繁中手寫本身是資料稀缺領域),且短篇與長篇表現落差大——短篇業務筆記約六成字元有誤,長篇內容更易產生語法通順但內容錯誤的幻覺。實測中,本模型在真實手寫上已優於通用視覺語言模型(同基準下,通用視覺語言模型在真實手寫上大量幻覺、CER 超過 100%),但距離生產可用仍有距離,屬公開預覽性質,重要用途請務必人工複核,歡迎回饋。
用途與限制
- 適用:台灣繁中印刷/掃描文件的地端 OCR、文件數位化、票據與筆記辨識前處理。
- 限制:
- 手寫辨識為實驗性,複雜潦草字跡仍可能出錯或產生幻覺,重要用途請人工複核。
- 純英文長段落尚未系統性驗證。
- 表格/版面複雜文件建議先切行/切格再辨識。
- 本模型輸出僅供辨識參考,不宜作為法律、醫療、財務等關鍵決策的唯一依據。
格式與相容性
本 repo 目前僅提供 bf16 safetensors(transformers 原生格式),尚未提供 GGUF 量化版本。
- 原因:Llama 3.2 Vision 使用的
mllama架構,llama.cpp 官方目前不支援轉換或載入(上游 issue 自 2024-09 未解決)。這代表 llama.cpp / llama-server / LM Studio / GPT4All 等以 llama.cpp 為底層的工具目前都無法運行本模型(市面上少數自稱支援的 mllama GGUF 是用 Ollama 私有 fork 轉出,僅能在該環境下運作,與標準 llama.cpp 生態不相容)。上游一旦支援,本 repo 會補上官方相容的 GGUF 版本。 - 可用方式:
transformers(Python)與vLLM皆原生支援mllama架構,可直接載入本模型。
硬體需求
bf16 權重約 21GB,建議:
- 推論:單張 ≥ 24GB VRAM 的 GPU(如 RTX 3090/4090、A10、L4、A100 等)可完整載入;記憶體不足可用
device_map="auto"搭配多卡分攤,或自行做 int8/int4 量化(bitsandbytes)降低需求。 - 純 CPU 推論理論可行但速度不實用,不建議。
用法 1:transformers
from transformers import MllamaForConditionalGeneration, AutoProcessor
from PIL import Image
import torch
model_id = "xCloudinfo/Llama-xReadable-11B-zhTW-OCR-v1"
model = MllamaForConditionalGeneration.from_pretrained(
model_id, torch_dtype=torch.bfloat16, device_map="auto"
).eval()
processor = AutoProcessor.from_pretrained(model_id)
image = Image.open("your_document.jpg").convert("RGB")
prompt = "請辨識圖片中的所有文字,逐字完整輸出,只輸出文字本身。"
messages = [{"role": "user", "content": [{"type": "image"}, {"type": "text", "text": prompt}]}]
text = processor.apply_chat_template(messages, add_generation_prompt=True, tokenize=False)
inputs = processor(text=[text], images=[image], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=768, do_sample=False)
print(processor.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))用法 2:vLLM(推薦用於伺服器部署/高吞吐)
vllm serve xCloudinfo/Llama-xReadable-11B-zhTW-OCR-v1 \
--dtype bfloat16 \
--max-model-len 4096啟動後以 OpenAI 相容 API(圖片以 image_url 傳入 messages)呼叫即可。
授權與來源聲明(Llama 3.2 Community License)
本模型為 Meta Llama 3.2 的衍生模型,散布須遵守 Llama 3.2 Community License Agreement。以下依該授權條款聲明:
- Built with Llama。 本模型以 Meta Llama 3.2 建構。
- 基底模型:`meta-llama/Llama-3.2-11B-Vision-Instruct`(Meta Platforms, Inc.)。Llama 3.2 為 Meta 之財產,
Llama Materials之權利與所有權屬 Meta。 - 模型命名:依 Llama 3.2 授權要求,衍生模型名稱以「Llama」開頭(本模型:
Llama-xReadable-11B-zhTW-OCR-v1)。 - 授權文本:本散布隨附 Llama 3.2 Community License Agreement 副本(見本 repo
LICENSE檔);使用、重製、散布本模型或其衍生物,須提供該授權副本並保留本聲明。 - 可接受使用政策:使用須遵守 Meta Acceptable Use Policy。
- 歐盟(EU)限制:Llama 3.2 授權規定,設立地或主要營業地在歐盟的個人或公司,不被授予使用 Llama 3.2 多模態模型所含之多模態能力的授權。歐盟主體請勿將本模型用於該等用途。
- 大規模服務門檻:若在 Llama 3.2 發布日,貴方(或關係企業)提供之產品/服務前一曆月的月活躍使用者超過 7 億,須另向 Meta 申請授權。
- 微調與散布由 云碩科技 xCloudinfo 進行;不得用於非法用途;須遵守中華民國相關法律。
Built with Llama. 由 云碩科技 xCloudinfo 於自有 AI 算力資源池微調、散布;基底模型之權利屬 Meta Platforms, Inc.。
