satsder/qwen3.8-flash-next-routing-traces
Qwen3.8 Flash Next Routing Traces 用于MoE路由、hidden预测及离线缓存分析的历史采集数据。不是模型权重,不是模型发布,也不是标准化性能基准。 本数据集配套Qwen3.8 Flash Next推理研究仓库。这里的模型名称沿用维护者的研究命名;不表示模型官方发布、官方认可或与其他同名模型版本兼容。数据来自基于llama.cpp深度修改的本地实验分支,不能假定上游llama.cpp可以直接重现全部采集行为。 归档已上传完成,Content-Length 与原文件一致,首尾片段校验相同;远端对象以SHA-256为存储键。 DATASET_INFO及归档内说明保留打包时的快照,其中"云盘链接尚未提供"等措辞已过期;当前分发地址以本页为准。 下载与核验 文件 用途 qwen3.8-hidden-routing-research.7z 5批原始采集与包内说明 SHA256SUMS.txt 压缩包SHA-256 archive-receipt.json… See the full description on the dataset page: https://huggingface.co/datasets/satsder/qwen3.8-flash-next-routing-traces.
Qwen3.8 Flash Next Routing Traces
用于MoE路由、hidden预测及离线缓存分析的历史采集数据。不是模型权重,不是模型发布,也不是标准化性能基准。
本数据集配套Qwen3.8 Flash Next推理研究仓库。这里的模型名称沿用维护者的研究命名;不表示模型官方发布、官方认可或与其他同名模型版本兼容。数据来自基于llama.cpp深度修改的本地实验分支,不能假定上游llama.cpp可以直接重现全部采集行为。
归档已上传完成,Content-Length 与原文件一致,首尾片段校验相同;远端对象以SHA-256为存储键。
DATASET_INFO及归档内说明保留打包时的快照,其中"云盘链接尚未提供"等措辞已过期;当前分发地址以本页为准。
下载与核验
压缩包大小为 49,235,820,003字节(45.85 GiB),包含 4,158,067个文件、202个目录;解压后逻辑大小 54,425,896,216字节(50.69 GiB)。大量小文件会增加实际磁盘占用和解压时间,建议使用独立空目录;不要解压到源码工作树。
SHA-256
bffd2233c8740c798067029c83620531f0cfedcad3ddb4a314e40094ac4e6c4d使用HF CLI下载到独立目录:
hf download satsder/qwen3.8-flash-next-routing-traces \
--repo-type dataset \
--local-dir ./qwen3.8-routing-traces下载后核对SHA-256,并用7-Zip检查:
7z t qwen3.8-hidden-routing-research.7zWindows PowerShell可用:
Get-FileHash .\qwen3.8-hidden-routing-research.7z -Algorithm SHA256这是原始归档分发格式。 .7z中的自定义CSV/bin组合不提供HF Dataset Viewer预览,也不能直接当作标准datasets.load_dataset()数据集使用。请按下述schema及详细说明编写读取程序。
数据组成
共85个采集请求目录,不等于85个独立提示词或标准训练样本。标准8提示词是标准20提示词的子集,标准20又是collect-run2的51提示词的子集。不同运行的生成历史、采集深度和实现版本不相同,不能跨运行拼接张量。同提示词的不同批次必须同组划分,避免训练/测试泄漏。本数据集没有预设的标准训练、验证或测试划分。
提示词、token历史及离线报告的小文件副本见GitHub轻量数据包。这54份提示词文件覆盖一般问答、代码、数学、科学、翻译和创作等合成任务,不代表真实用户流量或生产分布。
采集方式与身份边界
数据是在本地模型执行过程中,由修改后的采集器记录的中间张量、专家选择和token信息。目录日期是历史批次标识,不是此次发布时重新跑出的结果。
标准20/8批的启动脚本记录了--cpu-moe、上下文4096、Q8 KV、请求生成16 token、--temp 0及--no-warmup等设置,并保留成功退出的采集manifest。请求生成上限不等于实际生成token数。collect系列缺少完整启动/退出码manifest,不能把旧文档描述当作已完整恢复的命令行或二进制身份。现有记录也不足以将全部批次绑定到一个经过认证的模型/tokenizer/采集器完整哈希快照。
本次发布没有重跑模型,没有据此新增吞吐、质量或在线预测效果结论。
格式与正确读取
collect系列
hidden/hidden_meta.csv:graph_id,sched_id,layer,ne0,ne1,ne2,nb1,nb2,type,file。collect-run2的hidden记录为F32、ne0=2560;形状通常为[2560,1,nt],允许空维度。experts.csv:graph_id,split_id,layer,tensor,token_row,rank,expert_id,sched_id。tokens.csv:graph_id,ctx_id,pos,token_id。pos为microbatch内索引,不应直接当作全局上下文位置。router/rl_*.bin和router/rp_*.bin:单token图的512个F32值,每文件2048字节;不覆盖完整prefill。- 请求身份由外层目录确定;
sched_id和ctx_id属于不同命名空间,不是全局request ID。
collect-run2有1,197,360条hidden元数据记录、14,012,380条expert记录、29,285条token记录。这些行数都不能直接解释为独立样本数或生成token数。
standard系列
tensors.csv包含图、调度器、kind、layer、occurrence、ne0..ne3、nb0..nb3、type、bytes及文件名。
*bin按逻辑张量行紧密打包;metadata中的`nb是原tensor步长,不是归档文件步长。** 例如形状[10,2]的int32 topk只有80字节,即使原nb1=2048,也不能按这个步长跳读文件。浮点张量按记录的type解释。同kind可能重复出现,必须保留形状和_o<occurrence>`的区分。
标准20批每请求9,823条张量记录,共196,460条;标准8批每请求11,647条,共93,176条。标准token schema为request_id,graph_id,round,pos,token_id,phase,batch_size,与collect系列不同。
适用研究
- 同运行内的hidden到router/expert关系分析。
- 按提示词分组的路由预测研究及泛化检查。
- 基于已记录专家访问顺序的离线缓存覆盖分析。
- 在明确可用阶段张量和teacher-forcing条件下,研究局部hidden重建。
不适合直接据此宣称: 在线预测准确率、稳定推理加速、完整模型质量、跨模型泛化或生产负载收益。尤其旧报告的99%级direct recall使用记录下来的下一层attention残差,属于有条件离线评估,不能当作在线提前预测准确率。
验证、排除项与已知问题
- 7-Zip 26.01已对整个压缩包执行完整测试,结果
Everything is Ok;SHA-256已生成。 - 已核对归档成员只来自上述5批及
DATASET_INFO,扩展名只有bin、csv、json和md。 - 包含538个零字节bin;已逐一对照原metadata,全部预期大小为0,是保留的空张量,不是压缩丢失。
- collect-run2的hidden元数据及experts.csv字段已完整扫描;hidden键无重复,expert表没有字段数错误或重复表头。另抽查了每请求首尾hidden及单token router文件大小。
- 没有逐一验证所有张量的数值正确性。 压缩包完整性不是实验正确性认证。
- 第47层prefill的覆盖与其他层不同;应结合图输出token选择对齐,不要仅凭形状判断损坏,也不要未经核实就补齐。
- 部分请求记录较短,不能仅据此认定EOS原因或将它们补成等长序列。
- 已知截断的
standard-smoe-20-20260910、发生同名覆盖的早期smoke及其他开发smoke未混入主包;排除原因见inventory。
隐私、许可与责任边界
本包不包含模型权重、抽取的gate/HC权重、GGUF、NPY、可执行文件或原始运行日志。采集CSV原样保留;没有把本包描述为所有字段均已彻底匿名化的数据集。提示词公开副本经过内容检查和本机根路径替换,但不能将这一点外推为生成内容的全面安全审查。
模型生成内容可能包含错误、偏见或不当文本。研究者应自行检查用途、数据分布及风险,不应用作未经审核的事实或安全评估依据。
本卡不额外授予模型或第三方材料的许可,也不自动套用代码仓库的MIT等许可证。 当前不声明统一数据许可证;公开下载不等于无限制再分发或商业使用授权。复用者需要核对相关模型与材料的适用条款。
来源与反馈
维护者:`satsder`。代码与实验记录:starsder/qwen3.8-flash-next-inference-research。两处账号拼写不同。
引用或报告问题时,请记录本Dataset仓库的具体revision、压缩包SHA-256、原始批次目录和所用请求列表,以便区分数据版本与运行条件。可以通过HF Discussions或配套GitHub仓库提交问题。
