Language-conditioned imitation learning on LIBERO (test)
98.4Spatial ScoreLightVLA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| LightVLAScale (B)=7.7, Backbone=LLaMA-2, Tokens=78, Cond.=In-context2026.02 | 98.4 | 98.4 | 98.2 | 94.6 | 97.4 | |
| pi_0.5*Scale (B)=3.3, Backbone=PaliGemma, Tokens=512, Enc.=Tokenized, Entry=VLM, Cond.=Cross-attn2026.02 | 98 | 97.8 | 95.6 | 85.8 | 94.3 | |
| OpenVLA-OFTScale (B)=7.7, Backbone=LLaMA-2, Tokens=512, Cond.=In-context2026.02 | 97.6 | 98.4 | 97.9 | 94.5 | 97.1 | |
| ThinkProprioScale (B)=0.95, Backbone=Florence-2-L, Tokens=6, Enc.=Tokenized, Entry=VLM, Cond.=Cross-attn2026.02 | 97.6 | 98.4 | 98 | 95.2 | 97.3 | |
| FLOWERScale (B)=0.95, Backbone=Florence-2-L, Tokens=100, Cond.=Cross-attn2026.02 | 97.5 | 99.1 | 96.1 | 94.9 | 96.9 | |
| pi_0*Scale (B)=3.3, Backbone=PaliGemma, Tokens=512, Enc.=MLP, Entry=ACT, Cond.=Cross-attn2026.02 | 96.8 | 98.8 | 95.8 | 85.2 | 94.2 | |
| COA-VLAScale (B)=7, Backbone=Qwen2-VL, Enc.=MLP, Entry=Backbone, Cond.=In-context2026.02 | 85.3 | 93.1 | 85.8 | 55 | 79.8 | |
| OpenVLAScale (B)=7.7, Backbone=LLaMA-2, Tokens=256, Cond.=In-context2026.02 | 84.7 | 88.4 | 79.2 | 53.7 | 76.5 |