CoolFace
Modelpublic

XizoB/FastWAM-TDAA

sourceHugging Faceupdated 19h agoView on Hugging Face
0likes
Model Card

FastWAM-TDAA

新增:2026-09-18 的 25 epoch 训练产物

2026-09-21 上传了两组 25 epoch / 13,625 步训练产物,与下方旧版 5 epoch 结果分别归档。

模型训练目录最终权重训练监控视频
FastWAM 基线配置与日志step_013625.pt216 个
TDAA Frozen配置与日志step_013625.pt216 个

新版 Frozen 必须使用对应的 160k codec,与旧版 80k codec 不同。视频为训练开环监控;本次没有发布这两份新权重的完整闭环成功率,不能沿用下方旧版分数。

25 epoch 训练说明、超参数和下载方法 · 文件校验清单


以下为 2026-09-17 的 5 epoch 实验归档

本仓保存 RoboTwin 实测模型、TDAA codec、原始结果和 4,000 个视频。

GitHub 代码 · 方法与复现 README · 完整结果表

方法与模式

在 FastWAM 中接入预训练 TDAA version3_bin24 编解码器,将 [32,14] 动作块编码为 [8,16] latent。策略在 latent 空间做 flow matching,再解码为 32 步绝对关节动作。decoder 使用任务向量和由已执行动作历史的 DCT24 特征生成的 phase;每个 episode 重置历史。

模式配置本次发布
FastWAM 基线TDAA=false已测试权重、结果与视频
TDAA FrozenTDAA=true frozen=true已测试权重、结果与视频
TDAA 联合训练TDAA=true frozen=false代码支持,暂无已发布评测权重与成功率

frozen 控制整个 TDAA codec,FastWAM 策略仍参与训练。联合训练额外加入动作重构与进度预测损失。动作 token 从 32 个变为 8 个,仅表示动作表示压缩;本次没有端到端加速测量。

模型与资产

本节为旧版 5 epoch 模型及 80k codec。

模型下载
FastWAM 基线step_002725.pt
TDAA Frozenstep_002725.pt

代码仓的下载工具按固定版本获取文件并校验 SHA-256。在代码仓安装环境后运行:

bash
python scripts/download_models.py --model both
# 仅下载 codec 和统计等辅助资产
python scripts/download_models.py --assets-only
# 校验本地文件
python scripts/download_models.py --verify-only

权重保存到 checkpoints/released/{official,tdaa_frozen}/step_002725.pt。Wan VAE/T5/tokenizer 等基础模型、训练数据和 RoboTwin 仿真资产需另外准备,详见 GitHub 复现说明。本次不包含 optimizer/scheduler 完整训练状态。

训练超参数

本节仅记录旧版 5 epoch 配方;新增 25 epoch 配方见上方链接。

以下为 FastWAM 基线与 TDAA Frozen=True 两组实测训练的共同设置,已与各自保存的 config.yaml 和 train.log 核对。Frozen=False 入口继承这些默认值,但本次没有该模式的完整训练与评测记录。

超参数实测值
GPU / 每卡 batch / 梯度累积8 / 16 / 1
有效全局 batch128
优化器 / betas / epsilonAdamW / (0.9, 0.95) / 1e-8
峰值学习率 / weight decay1e-4 / 1e-2
学习率调度线性 warmup → cosine
warmup总步数的 5%,取整为 136 步
cosine 最低学习率1e-6(峰值的 1%)
epoch / 实际 optimizer steps5 / 2,725
梯度裁剪 / 随机种子最大范数 1.0 / 42
训练精度 / 分布式BF16 / DeepSpeed ZeRO-1,无 CPU offload
DataLoader workers每进程 8
数据量10 任务 × 50 轨迹,69,732 个完整训练窗口
动作 horizon / 原始动作维度32 / 14
视频输入三相机拼接,9 帧,384×320,帧间隔 4
视频 / 动作 flow loss 系数1.0 / 1.0
日志 / 开环监控 / 定期保存间隔10 / 500 / 2,500 optimizer steps;训练结束另存最终权重

2,725 = ceil(69,732 / 128) × 5。max_steps 原配置为 null,由数据量和 epoch 自动计算;本次发布的是最终 step_002725.pt。训练内监控使用已参与训练的 episode 0,不是独立验证集。

模式差异基线Frozen=TrueFrozen=False(配置默认值)
动作预测形状[32,14][8,16] latent[8,16] latent
TDAA codec不加载FP32,全部冻结FP32,与策略联合训练
额外重构 / progress MSE 系数不适用不计算1.0 / 0.1
codec 学习率不适用不更新与策略相同,共用上述调度

模型结构、归一化、调度推导与配置来源见 完整训练超参数说明。

RoboTwin 实验结论

本节成功率仅对应旧版 5 epoch 权重。

实验为 robotwin_eval_20260917_sh_uv:10 个任务,每任务 clean/random 各 100 次,每模型 2,000 次;seed=42、instruction_type=unseen、32 步动作 horizon、24 步重规划、10 步去噪。

模型cleanrandom合计成功/总数合并成功率
FastWAM 基线20.6%4.0%246/200012.30%
TDAA Frozen40.8%6.3%471/200023.55%

TDAA Frozen 在 clean、random 上分别提高 20.2、2.3 个百分点,合并提高 11.25 个百分点。official 是本项目重训练对照组的目录名,以上不是 FastWAM 官方论文分数。

两组策略共享 10 个任务、500 条训练轨迹与 69,732 个完整窗口;训练内 val 是监控数据。上表来自独立 simulator 闭环评测,unseen 指指令类型,不表示未见任务。

改善存在任务差异:clean 的 press_stapler 从 33% 降至 3%,open_laptop 从 45% 降至 43%;random 均值仍为 6.3%。本次没有多次独立训练的均值/方差,也未隔离动作表示、历史条件、任务向量及归一化各自的贡献,不能解释为单组件消融结论。

代码、模型与第三方组件的来源说明见 GitHub README及 TDAA 来源记录。