CoolFace
Datasetpublic

satsder/qwen3.8-flash-next-routing-traces

Qwen3.8 Flash Next Routing Traces 用于MoE路由、hidden预测及离线缓存分析的历史采集数据。不是模型权重,不是模型发布,也不是标准化性能基准。 本数据集配套Qwen3.8 Flash Next推理研究仓库。这里的模型名称沿用维护者的研究命名;不表示模型官方发布、官方认可或与其他同名模型版本兼容。数据来自基于llama.cpp深度修改的本地实验分支,不能假定上游llama.cpp可以直接重现全部采集行为。 归档已上传完成,Content-Length 与原文件一致,首尾片段校验相同;远端对象以SHA-256为存储键。 DATASET_INFO及归档内说明保留打包时的快照,其中"云盘链接尚未提供"等措辞已过期;当前分发地址以本页为准。 下载与核验 文件 用途 qwen3.8-hidden-routing-research.7z 5批原始采集与包内说明 SHA256SUMS.txt 压缩包SHA-256 archive-receipt.json… See the full description on the dataset page: https://huggingface.co/datasets/satsder/qwen3.8-flash-next-routing-traces.

sourceHugging Faceupdated 12d agoView on Hugging Face
0likes52downloads
Dataset Card

Qwen3.8 Flash Next Routing Traces

用于MoE路由、hidden预测及离线缓存分析的历史采集数据。不是模型权重,不是模型发布,也不是标准化性能基准。

本数据集配套Qwen3.8 Flash Next推理研究仓库。这里的模型名称沿用维护者的研究命名;不表示模型官方发布、官方认可或与其他同名模型版本兼容。数据来自基于llama.cpp深度修改的本地实验分支,不能假定上游llama.cpp可以直接重现全部采集行为。

归档已上传完成,Content-Length 与原文件一致,首尾片段校验相同;远端对象以SHA-256为存储键。

DATASET_INFO及归档内说明保留打包时的快照,其中"云盘链接尚未提供"等措辞已过期;当前分发地址以本页为准。

下载与核验

文件用途
qwen3.8-hidden-routing-research.7z5批原始采集与包内说明
SHA256SUMS.txt压缩包SHA-256
archive-receipt.json分批文件数量、字节数及完整性检查记录
DATASET_INFO/README.md张量格式、对齐规则与已知限制
DATASET_INFO/inventory.json采集清单及逐请求元数据汇总

压缩包大小为 49,235,820,003字节(45.85 GiB),包含 4,158,067个文件、202个目录;解压后逻辑大小 54,425,896,216字节(50.69 GiB)。大量小文件会增加实际磁盘占用和解压时间,建议使用独立空目录;不要解压到源码工作树。

text
SHA-256
bffd2233c8740c798067029c83620531f0cfedcad3ddb4a314e40094ac4e6c4d

使用HF CLI下载到独立目录:

bash
hf download satsder/qwen3.8-flash-next-routing-traces \
  --repo-type dataset \
  --local-dir ./qwen3.8-routing-traces

下载后核对SHA-256,并用7-Zip检查:

bash
7z t qwen3.8-hidden-routing-research.7z

Windows PowerShell可用:

powershell
Get-FileHash .\qwen3.8-hidden-routing-research.7z -Algorithm SHA256

这是原始归档分发格式。 .7z中的自定义CSV/bin组合不提供HF Dataset Viewer预览,也不能直接当作标准datasets.load_dataset()数据集使用。请按下述schema及详细说明编写读取程序。

数据组成

原始批次目录请求目录数主要内容与区别
collect-run13早期hidden、expert及token采集;无router目录
collect-run1b3同三提示词的独立重跑,增加router;不是给run1补写router
collect-run251多域hidden、router、expert及token采集
standard-smoe-20-20260910b20attention、HC、gate、专家贡献等阶段张量;未直接保存ffn_moe_input
standard-smoe-8-202609118增加ffn_moe_input的补采

共85个采集请求目录,不等于85个独立提示词或标准训练样本。标准8提示词是标准20提示词的子集,标准20又是collect-run2的51提示词的子集。不同运行的生成历史、采集深度和实现版本不相同,不能跨运行拼接张量。同提示词的不同批次必须同组划分,避免训练/测试泄漏。本数据集没有预设的标准训练、验证或测试划分。

提示词、token历史及离线报告的小文件副本见GitHub轻量数据包。这54份提示词文件覆盖一般问答、代码、数学、科学、翻译和创作等合成任务,不代表真实用户流量或生产分布。

采集方式与身份边界

数据是在本地模型执行过程中,由修改后的采集器记录的中间张量、专家选择和token信息。目录日期是历史批次标识,不是此次发布时重新跑出的结果。

标准20/8批的启动脚本记录了--cpu-moe、上下文4096、Q8 KV、请求生成16 token、--temp 0及--no-warmup等设置,并保留成功退出的采集manifest。请求生成上限不等于实际生成token数。collect系列缺少完整启动/退出码manifest,不能把旧文档描述当作已完整恢复的命令行或二进制身份。现有记录也不足以将全部批次绑定到一个经过认证的模型/tokenizer/采集器完整哈希快照。

本次发布没有重跑模型,没有据此新增吞吐、质量或在线预测效果结论。

格式与正确读取

collect系列

  • —hidden/hidden_meta.csv:graph_id,sched_id,layer,ne0,ne1,ne2,nb1,nb2,type,file。collect-run2的hidden记录为F32、ne0=2560;形状通常为[2560,1,nt],允许空维度。
  • —experts.csv:graph_id,split_id,layer,tensor,token_row,rank,expert_id,sched_id。
  • —tokens.csv:graph_id,ctx_id,pos,token_id。pos为microbatch内索引,不应直接当作全局上下文位置。
  • —router/rl_*.bin和router/rp_*.bin:单token图的512个F32值,每文件2048字节;不覆盖完整prefill。
  • —请求身份由外层目录确定;sched_id和ctx_id属于不同命名空间,不是全局request ID。

collect-run2有1,197,360条hidden元数据记录、14,012,380条expert记录、29,285条token记录。这些行数都不能直接解释为独立样本数或生成token数。

standard系列

tensors.csv包含图、调度器、kind、layer、occurrence、ne0..ne3、nb0..nb3、type、bytes及文件名。

*bin按逻辑张量行紧密打包;metadata中的`nb是原tensor步长,不是归档文件步长。** 例如形状[10,2]的int32 topk只有80字节,即使原nb1=2048,也不能按这个步长跳读文件。浮点张量按记录的type解释。同kind可能重复出现,必须保留形状和_o<occurrence>`的区分。

标准20批每请求9,823条张量记录,共196,460条;标准8批每请求11,647条,共93,176条。标准token schema为request_id,graph_id,round,pos,token_id,phase,batch_size,与collect系列不同。

适用研究

  • —同运行内的hidden到router/expert关系分析。
  • —按提示词分组的路由预测研究及泛化检查。
  • —基于已记录专家访问顺序的离线缓存覆盖分析。
  • —在明确可用阶段张量和teacher-forcing条件下,研究局部hidden重建。

不适合直接据此宣称: 在线预测准确率、稳定推理加速、完整模型质量、跨模型泛化或生产负载收益。尤其旧报告的99%级direct recall使用记录下来的下一层attention残差,属于有条件离线评估,不能当作在线提前预测准确率。

验证、排除项与已知问题

  • —7-Zip 26.01已对整个压缩包执行完整测试,结果Everything is Ok;SHA-256已生成。
  • —已核对归档成员只来自上述5批及DATASET_INFO,扩展名只有bin、csv、json和md。
  • —包含538个零字节bin;已逐一对照原metadata,全部预期大小为0,是保留的空张量,不是压缩丢失。
  • —collect-run2的hidden元数据及experts.csv字段已完整扫描;hidden键无重复,expert表没有字段数错误或重复表头。另抽查了每请求首尾hidden及单token router文件大小。
  • —没有逐一验证所有张量的数值正确性。 压缩包完整性不是实验正确性认证。
  • —第47层prefill的覆盖与其他层不同;应结合图输出token选择对齐,不要仅凭形状判断损坏,也不要未经核实就补齐。
  • —部分请求记录较短,不能仅据此认定EOS原因或将它们补成等长序列。
  • —已知截断的standard-smoe-20-20260910、发生同名覆盖的早期smoke及其他开发smoke未混入主包;排除原因见inventory。

隐私、许可与责任边界

本包不包含模型权重、抽取的gate/HC权重、GGUF、NPY、可执行文件或原始运行日志。采集CSV原样保留;没有把本包描述为所有字段均已彻底匿名化的数据集。提示词公开副本经过内容检查和本机根路径替换,但不能将这一点外推为生成内容的全面安全审查。

模型生成内容可能包含错误、偏见或不当文本。研究者应自行检查用途、数据分布及风险,不应用作未经审核的事实或安全评估依据。

本卡不额外授予模型或第三方材料的许可,也不自动套用代码仓库的MIT等许可证。 当前不声明统一数据许可证;公开下载不等于无限制再分发或商业使用授权。复用者需要核对相关模型与材料的适用条款。

来源与反馈

维护者:`satsder`。代码与实验记录:starsder/qwen3.8-flash-next-inference-research。两处账号拼写不同。

引用或报告问题时,请记录本Dataset仓库的具体revision、压缩包SHA-256、原始批次目录和所用请求列表,以便区分数据版本与运行条件。可以通过HF Discussions或配套GitHub仓库提交问题。