2041Xu/mechanism-merging-exp089-handoff
Mechanism Merging Exp089 analysis handoff 这是 weekly_experiment_report_20260812.md 对应版本的公开研究交付仓库。它保存报告第 8、10、11 章 所用的模型、训练数据、逐样本评测轨迹和分析实物;代码、可直接浏览的报告与图片位于私有 GitHub 仓库 xlxcomputer/mechanism-merging-exp089-repro。 四个分析输入模型 目录 角色 冻结点 训练成本口径 checkpoints/anchor_mixed_stage1_step10014/huggingface/ 三种方法共同且唯一的 mixed Stage-1 anchor step 10014 共同成本,不进入方法横轴 checkpoints/mix-rl_step1036/huggingface/ Mix-RL final step 1036 online FLOPs 100210702010088587264… See the full description on the dataset page: https://huggingface.co/datasets/2041Xu/mechanism-merging-exp089-handoff.
Mechanism Merging Exp089 analysis handoff
这是 weekly_experiment_report_20260812.md 对应版本的公开研究交付仓库。它保存报告第 8、10、11 章 所用的模型、训练数据、逐样本评测轨迹和分析实物;代码、可直接浏览的报告与图片位于私有 GitHub 仓库 xlxcomputer/mechanism-merging-exp089-repro。
四个分析输入模型
每个目录都包含标准 Hugging Face 权重、tokenizer/config 和源归档 metadata。这里交付的是实际用于 第 8、10、11 章分析的 model-only Hugging Face export,不包含只对继续训练有用的 optimizer/FSDP shard。四个模型均有 311 个 safetensors tensor entries,下载后可直接用于推理和参数分析。
由于本仓库的类型是 dataset,推荐先下载整个快照,再从子目录加载:
from huggingface_hub import snapshot_download
from transformers import AutoModelForCausalLM, AutoTokenizer
root = snapshot_download(
"2041Xu/mechanism-merging-exp089-handoff",
repo_type="dataset",
)
model_dir = f"{root}/checkpoints/mix-rl_step1036/huggingface"
tokenizer = AutoTokenizer.from_pretrained(model_dir)
model = AutoModelForCausalLM.from_pretrained(model_dir, device_map="auto")分析材料
Chapter 8:等总 FLOPs 的 Level1–8 对比
analysis/chapter8_level_curves/weekly_20260812_eval_trajectories.zip:52 次实际归档评测,包含 Mix-RL 29 次、MOPD 12 次、SFT 11 次;638,976 条完整 response/trajectory,按method/eval-point/domain/split/level分层为 2,496 个 Parquet。- 同目录 JSON/PNG:W&B 曲线取数快照、三方法端点图和六套 Level1–8 FLOPs 曲线。
- 主结果:Mix-RL/MOPD/SFT 六套宏平均分别为 21.91%/21.40%/18.29%。Mix-RL 的优势主要来自 String,Table 小幅领先 MOPD;PhantomWiki 上 MOPD/SFT 更高。
Chapter 10:最终模型参数空间
analysis/chapter10_parameter_geometry/:全局、逐 tensor、逐 module、pairwise、谱与代表矩阵的 CSV/JSON,16 个计算 shard 的审计输出,以及 PNG/PDF 图。- 主结果:Mix-RL 的参数位移最小且谱方向最分散;MOPD 更新更集中、受 expert 指向更强;SFT 改动最大,并把 41.27% 的更新能量放在 tied embedding/lm-head,显著改写公共输入输出接口。
Chapter 11:GPT-OSS-120B failure modes
analysis/chapter11_failure_modes/labeled_cases.jsonl:逐 case 标签。failure_mode_case_browser.html:无需服务端的可交互 case browser。failure_mode_counts.csv、method_domain_summary.csv、summary.json:汇总结果。- 主结果:String 的错误同时包含局部执行和组合错误;Table 错误主要来自 schema/data-flow 的组合 传播;PhantomWiki 的错误最集中于条件分支和 role swap/rotation 的组合传播。
训练数据
training_data/ 包含:
mixed_stage1_rft/:641,014 条三域正确轨迹及 3,072 条 validation;共同 anchor 的实际输入。stage2_fresh_sources/:初始 fresh 90K、第一轮 disjoint 100K、第二轮 disjoint 100K;含聚合 train Parquet、domain source、manifest 和独立污染/重复审计。expert_sources/:String 50K+10K、Table 20K+4K、PhantomWiki 20K+4K 的实际 expert source。sft_selected_correct_trajectories/:SFT 最终单遍训练的 46,944 条正确 expert 轨迹以及逐样本 FLOPs 账本。
训练数据的 split、行数、SHA 和污染边界以各目录 manifest/audit 为准;不要用目录中不存在的旧版 或被纠正的数据口径替代。
完整性
MANIFEST.json:交付版本、逻辑分组和逐文件大小/SHA-256。SHA256SUMS:下载后可运行sha256sum -c SHA256SUMS。_SUCCESS与artifact_manifest.json来自原始对象归档;上传前已对所交付的模型文件重新计算 SHA-256 并与源 manifest 对齐。
这些材料仅用于本次公开研究协作。上游代码和数据可能有各自许可;不要在未完成许可核对前随意 再分发。
