Cache-SCA/IsaacLab-smolVLA-SO101-Multitask-8epoch_LoRA
04
IsaacLab-smolVLA-SO101-Multitask-8epoch
lerobot/smolvla_base 를 IsaacLab 시뮬레이션 SO101 11-task 데이터셋 CoRL2026-CSI/Isaaclab-so101_11task_baseCaP_3300epi_10fps 으로 8 epoch 파인튜닝한 SmolVLA 정책.
이 체크포인트는 LoRA adapter 입니다 (adapter_model.safetensors). base 모델 lerobot/smolvla_base 와 함께 로드됩니다.
Model details
- Base model:
lerobot/smolvla_base(SmolVLM2-500M-Video-Instruct VLM + action expert) - Robot: SO101 (6-DOF, gripper 포함) — IsaacLab 시뮬레이션
- Cameras:
top,left_wrist(480×640) — 정책 키camera1(left_wrist) /camera2(top) 로 rename - Inputs:
observation.state[6] + 카메라 2개 + language instruction (task) - Output:
action[6] (joint position) - Action chunking:
chunk_size=50,n_action_steps=50
Fine-tuning strategy (PEFT / LoRA)
핵심: action expert 와 projection 레이어는 full fine-tune, VLM backbone 은 q/v_proj 에만 LoRA, 그 외 VLM 은 완전 freeze.
Trainable / Frozen breakdown
즉 frozen 인 것은 VLM backbone 의 대부분(vision encoder 포함) + VLM 의 k_proj/o_proj/MLP/embedding/LayerNorm. 학습되는 것은 VLM q/v_proj 의 LoRA adapter + action expert 전체 + 모든 projection 레이어.
LoRA / PEFT config
저장된 adapter 텐서: 267개 (LoRA A/B 112개 — VLM qproj·vproj / full-trained 155개 — expert·projection).
Training hyperparameters
Camera rename
Usage
from lerobot.policies.smolvla.modeling_smolvla import SmolVLAPolicy
policy = SmolVLAPolicy.from_pretrained("CoRL2026-CSI/IsaacLab-smolVLA-SO101-Multitask-8epoch")Citation / Acknowledgement
Built on top of LeRobot and the SmolVLA base checkpoint. Project: CoRL 2026 CSI submission.
Framework versions
- PEFT 0.19.1
- LeRobot 0.5.2
