CoolFace
Modelpublic

RichardErkhov/p208p2002_-_llama-3-zhtw-8B-gguf

sourceHugging Faceupdated 2y agoView on Hugging Face
0likes447downloads
Model Card

Quantization made by Richard Erkhov.

Github

Discord

Request more models

llama-3-zhtw-8B - GGUF

  • —Model creator: https://huggingface.co/p208p2002/
  • —Original model: https://huggingface.co/p208p2002/llama-3-zhtw-8B/

Original model description: --- datasets:

  • —HuggingFaceFW/fineweb
  • —erhwenkuo/c4-chinese-zhtw
  • —erhwenkuo/wikipedia-zhtw
  • —p208p2002/wudao
  • —p208p2002/NDLTD-T10-90-111
  • —codeparrot/github-code-clean language:
  • —en
  • —zh license: llama3 ---

Llama 3 zhtw

在 Llama 3 上試驗中文 Continue Pretraining (CP),共計訓練 800M tokens。

由於中文預訓練語料品質還有改進空間,CP 後表現未能超越原版 Llama 3,我們比較幾個開源社群訓練的中文 Llama 3 也有類似狀況。

在英文方面 LLaMA 3 zhtw 使用 FineWeb,使得 MMLU 表現高於其他中文CP模型,能力與原版 LLaMA 3 持平。

Benchmarks

Models↑ TMMLU+ (ACC)CMMLU (ACC)MMLU (ACC)
TC, KnowledgeCN, KnowledgeEN, Knowledge
5 shot5 shot5 shot
Yi-6B6B49.6375.5365.35
Qwen-7B7B42.8473.161.00
Meta-Llama-3-8B8B41.9750.865.17
p208p2002/llama-3-zhtw-8B8B41.8450.665.31
Breeze-7B-Base-v0_17B40.3544.0561.63
hfl/llama-3-chinese-8b8B39.6450.961.1

Recipe

Datasets

DatasetLangWeight
FineWeben0.35
Wudaozh-cn0.1
C4Twzh-tw0.1
WikiZhTwzh-tw0.15
NdltdT10zh-tw0.1
GitHubMarkDowncode0.1
GitHubPythoncode0.1

Hyper Parameters

  • —Learning Rate: 1e-7
  • —Global Batch Size: 60
  • —Sequence Length: 8192