MolmoAct2-LIBERO-LP-VTP-SD โ€” ํ†ตํ•ฉ ์••์ถ• (Layer Prune + Vision Token Prune + Step Decrease)

allenai/MolmoAct2-LIBERO (5.44B VLA)์— ์„ธ ๊ฐ€์ง€ ์••์ถ• ๊ธฐ๋ฒ•์„ ๋™์‹œ ์ ์šฉํ•ด LIBERO๋กœ fine-tuneํ•œ LeRobot ํฌ๋งท ์ฒดํฌํฌ์ธํŠธ.

๊ธฐ๋ฒ• ๋‚ด์šฉ ํšจ๊ณผ
LP (layer pruning) ViT 25L โ†’ 10L ํ•™์ƒ(xpuenabler/MolmoAct2-LIBERO-ViT10L)์—์„œ ์‹œ์ž‘ ViT ํŒŒ๋ผ๋ฏธํ„ฐ 439M โ†’ 212M
VTP (vision token pruning) Grid Sampler, ์ด๋ฏธ์ง€๋‹น K=16 ํ† ํฐ prefill seq_len 489 โ†’ 129
SD (step decrease) flow-matching num_flow_timesteps=2 ํ•™์Šต, 2-step ๋””์ฝ”๋“œ / n_action_steps=2 action head ๋””์ฝ”๋“œ ~5ร— ์ถ•์†Œ

ํ•™์Šต

  • ์ฝ”๋“œ: nota-github/xpu-lerobot @ feat/lp+vtp+sd-libero (scripts/train_molmoact2_libero_vtp+lp+sd.sh)
  • ๋ฐ์ดํ„ฐ: allenai/MolmoAct2-LIBERO-Dataset, 20000 steps, effective batch 32 (4ร—B200 DDP, per-GPU 8), bf16, seed 1000
  • Grid Sampler ๊ฐ€์ค‘์น˜๋Š” random init์—์„œ ํ•™์Šต, ๋‚˜๋จธ์ง€๋Š” ViT10L ํ•™์ƒ์—์„œ warm-start

์„ฑ๋Šฅ

  • LIBERO 4-suite ํ‰๊ฐ€ ๋ฐ module-wise latency๋Š” Confluence ๋ฌธ์„œ "Pruning/Distilation ์ข…ํ•ฉ (LP+VTP+SD) MolmoAct2 ์ ์šฉ ๋ฐ ์„ฑ๋Šฅ ํ‰๊ฐ€" ์ฐธ๊ณ  (10000-step ์ฒดํฌํฌ์ธํŠธ ๊ธฐ์ค€ ์ธก์ •; ๋ณธ repo๋Š” ์ตœ์ข… 20000-step).
  • B200 batch=1 ์ฐธ๊ณ ์น˜ (2-step ๋””์ฝ”๋“œ): TOTAL ~94ms/decision (vision 5.8 / llm 20.3 / action head 52.4 ms).

์‚ฌ์šฉ (LeRobot)

lerobot-eval \
  --policy.path=xpuenabler/MolmoAct2-LIBERO-LP-VTP-SD \
  --policy.inference_action_mode=continuous \
  --policy.num_inference_steps=2 \
  --env.type=libero ...

์ฃผ์˜: Grid Sampler๋Š” single-crop(crop_mode="resize") ์ „์šฉ.

Downloads last month
50
Safetensors
Model size
5B params
Tensor type
F32
ยท
BF16
ยท
Video Preview
loading

Model tree for xpuenabler/MolmoAct2-LIBERO-LP-VTP-SD

Finetuned
(1)
this model
Quantizations
1 model