ChatoyantAI/gemma-4-12b-roleplay-sft-regmix-v2
Gemma 4 12B Roleplay SFT RegMix v2
基于 google/gemma-4-12B-it 的 LoRA 适配器。使用经预处理和筛选的六个公开数据来源,以 RegMix config-025 配比组成 50,000 条训练数据;不包含 Lusy,也不以 Lusy 为筛选或优化目标。
row% 为样本数占比,target token 为按本次 Gemma tokenizer 和训练监督区间统计的单轮数据集监督 token 总数,tgt% 为其占比;中位数按逐条样本的监督 token 数计算,合计行为全部 50,000 条的中位数。百分比四舍五入。训练共 2 个 epoch;表中不重复计数。不同基座 tokenizer 下的 token 数不能与 v1 直接等同比较。
六个来源分别为 CoSER、XPersona、Aya、Tulu-3-SFT-Mixture、SmolTalk 和 Infinity-Instruct。混合数据包含 50,000 个唯一 ID、50,000 个唯一内容哈希,与留出集的分组重叠数为 0。
训练集 SHA-256:8c626b338270652de2e4d1130b28d8b0fc2c2eca0b90f5dcffa7580a26e0d859。
训练配置
配比来自 64 个 Gemma-E2B 代理配置及候选确认实验。此版本发布已完成的 config-025 正式训练产物;不将其宣称为 Gemma 12B 上已证明的全局最佳配比。
文件说明
本仓库包含 LoRA 权重、适配器配置、tokenizer 和 chat template;不包含合并后的基座权重。加载时使用 google/gemma-4-12B-it 基座并挂载本仓库的 PEFT 适配器。基座采用 Gemma 4 unified 架构,训练时使用 AutoModelForImageTextToText 加载,LoRA 仅作用于文本解码器。
