RichardErkhov/p208p2002_-_llama-3-zhtw-8B-gguf
0447
Quantization made by Richard Erkhov.
llama-3-zhtw-8B - GGUF
- Model creator: https://huggingface.co/p208p2002/
- Original model: https://huggingface.co/p208p2002/llama-3-zhtw-8B/
Original model description: --- datasets:
- HuggingFaceFW/fineweb
- erhwenkuo/c4-chinese-zhtw
- erhwenkuo/wikipedia-zhtw
- p208p2002/wudao
- p208p2002/NDLTD-T10-90-111
- codeparrot/github-code-clean language:
- en
- zh license: llama3 ---
Llama 3 zhtw
在 Llama 3 上試驗中文 Continue Pretraining (CP),共計訓練 800M tokens。
由於中文預訓練語料品質還有改進空間,CP 後表現未能超越原版 Llama 3,我們比較幾個開源社群訓練的中文 Llama 3 也有類似狀況。
在英文方面 LLaMA 3 zhtw 使用 FineWeb,使得 MMLU 表現高於其他中文CP模型,能力與原版 LLaMA 3 持平。
Benchmarks
Recipe
Datasets
Hyper Parameters
- Learning Rate: 1e-7
- Global Batch Size: 60
- Sequence Length: 8192
