koharachan/cabbage-repair-v6-clean-from-v4
1
cabbage-repair-v6-clean-from-v4
Cabbage 项目的实验性研究 checkpoint(repair v6,从 v4 继续修复训练得到的版本)。不是生产模型。
模型概况
- 架构:
FrontierHybridLM(KDA recurrent mixer + gated MLA/compressed attention + IndexShare 稀疏检索 + MoE shared experts + MTP) - 参数量:1,285,169,712(约 1.29B)
- vocab 65,792;hidden 1,536;24 层;24 头;maxseqlen 8,192
- 训练状态:step 120,tokens_seen 19,381
- 精度:FP32,model-only checkpoint(不含 optimizer/scheduler,不能无缝续训)
- 能力评估:28 题 probe 得分 16/28(能对话,但不稳定)
文件
加载方式
需要 Cabbage 项目运行时(edge_llm),与 checkpoint 一起提供 model.json 和 tokenizer.json:
from edge_llm.frontier_parts.model import FrontierHybridLM
from edge_llm.frontier_parts.config import FrontierConfig
import json, torch
cfg = FrontierConfig(**json.load(open("model.json"))["config"])
model = FrontierHybridLM(cfg)
state = torch.load("final.pt", map_location="cpu", weights_only=True)
model.load_state_dict(state["model"])已知限制
- 实验性研究权重,step 数很少,能力分布不均
- 训练数据包含本地对话蒸馏等来源,许可证混合,未做完整审计
- 输出不可靠,请勿用于重要决策或自动化生产
许可证
项目代码为 MIT。权重按原样提供(as-is),底层训练数据的许可状态未完全审计,使用者自行评估。
