CoolFace
Modelpublic

ChatoyantAI/gemma-4-12b-roleplay-sft-regmix-v2

sourceHugging Faceupdated 9d agoView on Hugging Face
0likes27downloads
Model Card

Gemma 4 12B Roleplay SFT RegMix v2

基于 google/gemma-4-12B-it 的 LoRA 适配器。使用经预处理和筛选的六个公开数据来源,以 RegMix config-025 配比组成 50,000 条训练数据;不包含 Lusy,也不以 Lusy 为筛选或优化目标。

域行数row%target tokentgt%target 中位数
coser22,63745.27%831,20714.40%30
xpersona2,6725.34%36,2610.63%13
aya6,34612.69%857,37114.85%43
tulu1,3822.76%325,0995.63%110
smoltalk9,46618.93%2,932,98050.80%282
infinity7,49714.99%791,05013.70%22
合计50,000100%5,773,968100%35

row% 为样本数占比,target token 为按本次 Gemma tokenizer 和训练监督区间统计的单轮数据集监督 token 总数,tgt% 为其占比;中位数按逐条样本的监督 token 数计算,合计行为全部 50,000 条的中位数。百分比四舍五入。训练共 2 个 epoch;表中不重复计数。不同基座 tokenizer 下的 token 数不能与 v1 直接等同比较。

六个来源分别为 CoSER、XPersona、Aya、Tulu-3-SFT-Mixture、SmolTalk 和 Infinity-Instruct。混合数据包含 50,000 个唯一 ID、50,000 个唯一内容哈希,与留出集的分组重叠数为 0。

训练集 SHA-256:8c626b338270652de2e4d1130b28d8b0fc2c2eca0b90f5dcffa7580a26e0d859。

训练配置

项目配置
基座google/gemma-4-12B-it
产物config-025,最终第 6,250 步 LoRA 适配器
LoRAr=32,alpha=64,dropout=0;文本解码器 attention/MLP 投影层
可训练参数131,137,536
训练轮数2
最大序列长度8,192
学习率1e-4,cosine,warmup 10%
批次2 GPU × 每卡 micro-batch 4 × 梯度累积 2 = 有效批次 16
精度BF16
目标函数先对每条样本的监督 token NLL 取均值,再对样本取均值
完成时间2026-09-17 19:40 UTC

配比来自 64 个 Gemma-E2B 代理配置及候选确认实验。此版本发布已完成的 config-025 正式训练产物;不将其宣称为 Gemma 12B 上已证明的全局最佳配比。

文件说明

本仓库包含 LoRA 权重、适配器配置、tokenizer 和 chat template;不包含合并后的基座权重。加载时使用 google/gemma-4-12B-it 基座并挂载本仓库的 PEFT 适配器。基座采用 Gemma 4 unified 架构,训练时使用 AutoModelForImageTextToText 加载,LoRA 仅作用于文本解码器。