CoolFace
Apppublic

CHwensX/llama-415m-chinese-1600steps-space

sourceHugging Faceupdated 4mo agoView on Hugging Face
0likes
App README

LLaMA 415M 中文预训练模型 (1600 Steps)

从零训练的 LLaMA 架构 Decoder-Only Transformer 模型,基于中文 FineWeb-Edu 语料预训练。

模型信息

  • —架构: 标准 LLaMA (RMSNorm + RoPE + SwiGLU FFN)
  • —参数量: ~415M
  • —层数: 24
  • —隐藏维度: 1024
  • —注意力头数: 16 (GQA=8)
  • —词表大小: 55,296
  • —上下文长度: 2,048
  • —训练数据: 中文 FineWeb-Edu 预训练
  • —训练步数: 1,600 steps
  • —模型仓库: CHwensX/llama-415m-chinese-1600steps

使用说明

在输入框中输入提示词,调整温度/Top-K/Top-P 参数后点击「生成」按钮即可。

模型会基于你的提示词进行中文文本续写。

技术特点

  • —使用 HuggingFace 原生 AutoModelForCausalLM 加载,无需自定义代码
  • —支持 CUDA / MPS / CPU 多种推理设备
  • —支持 Temperature / Top-K / Top-P 采样参数控制