CoolFace
Modelpublic

xpuenabler/MolmoAct2-LIBERO-Drift-Keystone

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
0likes5downloads
Model Card

MolmoAct2-LIBERO-Drift-Keystone — 1-step action expert

allenai/MolmoAct2-LIBERO의 flow-matching action expert를 Drift(one-step drifting loss, arXiv:2602.04770)로 재학습하여 추론 시 Euler 적분을 10-step → 1-step으로 줄인 VLA. KeyStone(기하 자기일관성 best-of-K 선택, arXiv:2605.08638)을 추론 옵션으로 지원. VLM 백본·expert 구조·체크포인트 포맷은 원본과 동일(추가 파라미터 0). LeRobot 포맷.

성능 (LIBERO 4-suite × task당 20 ep = 800 ep, seed 1000)

libero_10goalobjectspatial**전체**
원본 baseline (10-step FM)95.095.599.598.597.1
본 모델 (1-step)94.597.599.599.097.6
본 모델 (1-step + KeyStone K=8/C=4)95.596.5100.099.597.9

Latency (B200, batch=1, eager): action head 228.3 → 26.9 ms (8.5×↓), 전체 decision 260.6 → 56.6 ms (4.6×↓), KeyStone +3.7 ms.

학습

  • —코드: nota-github/xpu-lerobot @ feat/molmoact2-drift-keystone
  • —레시피: drifting loss (G=8, action-dimension grouping, temps {0.02, 0.05, 0.2}, flow time t=0 pin), allenai/MolmoAct2-LIBERO-Dataset, 10k steps, eff batch 32, bf16, seed 1000
  • —스크립트: scripts/train_molmoact2_libero_drift_ddp2.sh

사용 (lerobot, 위 브랜치 필요 — config의 drifting*/testtime_* 키 파싱)

bash
# 1-step 평가
POLICY_PATH=xpuenabler/MolmoAct2-LIBERO-Drift-Keystone \
  scripts/eval_molmoact2_drift_libero.sh full

# KeyStone best-of-8 (거의 공짜: +3.7ms)
POLICY_PATH=xpuenabler/MolmoAct2-LIBERO-Drift-Keystone KEYSTONE_K=8 KEYSTONE_C=4 \
  scripts/eval_molmoact2_drift_libero.sh full

핵심 플래그: --policy.num_inference_steps=1 (필수 — 학습된 생성기와 일치), --policy.test_time_samples=8 --policy.test_time_clusters=4 (KeyStone, 선택).

평가 상세: Confluence "Flow-matching steps 감소를 위한 Drift 적용 및 성능 평가" (page 2426404865).