Embodied Navigation on Navigation
88Base ScoreGRPO w/ Mask
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GRPO w/ MaskBackbone=Qwen2.5-VL-3B, Reward Strategy=RL Baseline, Reasoning Strategy=World Model Reasoning Strategy2026.05 | 88 | 81 | 85 | |
| GLANCE-FullBackbone=Qwen2.5-VL-3B, Reward Strategy=Dense Extrinsic, Reasoning Strategy=World Model Reasoning for Visual States2026.05 | 86 | 88 | 87 | |
| GLANCE-BaseBackbone=Qwen2.5-VL-3B, Reward Strategy=Sparse Extrinsic, Reasoning Strategy=World Model Reasoning Strategy2026.05 | 81 | 81 | 81 | |
| VAGEN-FullBackbone=Qwen2.5-VL-3B, Reward Strategy=Dense Extrinsic, Reasoning Strategy=World Model Reasoning for Visual States2026.05 | 80 | 81 | 81 | |
| VAGEN-BaseBackbone=Qwen2.5-VL-3B, Reward Strategy=Sparse Extrinsic, Reasoning Strategy=World Model Reasoning Strategy2026.05 | 78 | 80 | 79 | |
| Turn-PPO w/ MaskBackbone=Qwen2.5-VL-3B, Reward Strategy=Turn-level PPO, Reasoning Strategy=World Model Reasoning Strategy2026.05 | 78 | 84 | 81 | |
| GLANCE w/ Turn-PPOBackbone=Qwen2.5-VL-3B, Reward Strategy=Turn-level PPO, Reasoning Strategy=World Model Reasoning Strategy2026.05 | 78 | 80 | 79 | |
| o4-mini2026.05 | 75 | 75 | 75 | |
| GPT-4o2026.05 | 75 | 69 | 72 | |
| Qwen2.5-VL-72BBackbone=Qwen2.5-VL-72B2026.05 | 70 | 77 | 74 | |
| Claude 4.5 Sonnet2026.05 | 67 | 67 | 67 | |
| Gemini 2.5 Pro2026.05 | 63 | 63 | 63 | |
| Claude 3.7 Sonnet2026.05 | 48 | 47 | 47 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2026.05 | 33 | 38 | 35 | |
| VLM-R1-3BBackbone=VLM-R1-3B2026.05 | 33 | 34 | 34 | |
| Vanilla-PPOBackbone=Qwen2.5-VL-3B, Reward Strategy=RL Baseline, Reasoning Strategy=World Model Reasoning Strategy2026.05 | 32 | 25 | 29 | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B2026.05 | 20 | 26 | 23 |