CHwensX/llama-415m-chinese-1600steps-space
0
LLaMA 415M 中文预训练模型 (1600 Steps)
从零训练的 LLaMA 架构 Decoder-Only Transformer 模型,基于中文 FineWeb-Edu 语料预训练。
模型信息
- 架构: 标准 LLaMA (RMSNorm + RoPE + SwiGLU FFN)
- 参数量: ~415M
- 层数: 24
- 隐藏维度: 1024
- 注意力头数: 16 (GQA=8)
- 词表大小: 55,296
- 上下文长度: 2,048
- 训练数据: 中文 FineWeb-Edu 预训练
- 训练步数: 1,600 steps
- 模型仓库: CHwensX/llama-415m-chinese-1600steps
使用说明
在输入框中输入提示词,调整温度/Top-K/Top-P 参数后点击「生成」按钮即可。
模型会基于你的提示词进行中文文本续写。
技术特点
- 使用 HuggingFace 原生
AutoModelForCausalLM加载,无需自定义代码 - 支持 CUDA / MPS / CPU 多种推理设备
- 支持 Temperature / Top-K / Top-P 采样参数控制
