CoolFace
Modelpublic

koharachan/cabbage-repair-v6-clean-from-v4

sourceHugging Facemitupdated 2mo agoView on Hugging Face
1likes
Model Card

cabbage-repair-v6-clean-from-v4

Cabbage 项目的实验性研究 checkpoint(repair v6,从 v4 继续修复训练得到的版本)。不是生产模型。

模型概况

  • —架构:FrontierHybridLM(KDA recurrent mixer + gated MLA/compressed attention + IndexShare 稀疏检索 + MoE shared experts + MTP)
  • —参数量:1,285,169,712(约 1.29B)
  • —vocab 65,792;hidden 1,536;24 层;24 头;maxseqlen 8,192
  • —训练状态:step 120,tokens_seen 19,381
  • —精度:FP32,model-only checkpoint(不含 optimizer/scheduler,不能无缝续训)
  • —能力评估:28 题 probe 得分 16/28(能对话,但不稳定)

文件

文件说明
final.ptPyTorch checkpoint(keys: model / step / tokens_seen / checkpoint_mode)
model.jsonFrontierHybridLM 配置
tokenizer.jsonBPE tokenizer
done.flag训练完成标记
SHA256SUMS校验文件

加载方式

需要 Cabbage 项目运行时(edge_llm),与 checkpoint 一起提供 model.json 和 tokenizer.json:

python
from edge_llm.frontier_parts.model import FrontierHybridLM
from edge_llm.frontier_parts.config import FrontierConfig
import json, torch

cfg = FrontierConfig(**json.load(open("model.json"))["config"])
model = FrontierHybridLM(cfg)
state = torch.load("final.pt", map_location="cpu", weights_only=True)
model.load_state_dict(state["model"])

已知限制

  • —实验性研究权重,step 数很少,能力分布不均
  • —训练数据包含本地对话蒸馏等来源,许可证混合,未做完整审计
  • —输出不可靠,请勿用于重要决策或自动化生产

许可证

项目代码为 MIT。权重按原样提供(as-is),底层训练数据的许可状态未完全审计,使用者自行评估。