Spatial Navigation on Spatial Navigation (OOD)
39.2Success Rate (7x7 Grid)VRRL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VRRLArchitecture=Qwen3-VL-4B-Instruct, Training Stage=RL2026.07 | 39.2 | 52.2 | |
| VRRLArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=RL2026.07 | 23.6 | 39.2 | |
| Multi-SFTArchitecture=Qwen3-VL-4B-Instruct, Training Stage=SFT2026.07 | 21.2 | 40.8 | |
| Reflection TuningArchitecture=Qwen3-VL-4B-Instruct, Training Stage=SFT2026.07 | 13.2 | 38.4 | |
| Reflection TuningArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=SFT2026.07 | 12.4 | 31 | |
| Multi-SFT → GRPOArchitecture=Qwen3-VL-4B-Instruct, Training Stage=RL2026.07 | 10.4 | 36 | |
| Multi-SFTArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=SFT2026.07 | 10.2 | 25.9 | |
| Multi-SFT → GRPOArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=RL2026.07 | 9.2 | 26 | |
| Single-SFTArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=SFT2026.07 | 8.8 | 24 | |
| Single-SFT → GRPOArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=RL2026.07 | 8.8 | 29 | |
| Single-SFTArchitecture=Qwen3-VL-4B-Instruct, Training Stage=SFT2026.07 | 8 | 32.4 | |
| Base*Architecture=Qwen3-VL-4B-Instruct, Training Stage=SFT2026.07 | 5.6 | 27.6 | |
| Single-SFT → GRPOArchitecture=Qwen3-VL-4B-Instruct, Training Stage=RL2026.07 | 5.6 | 34 | |
| Base*Architecture=Qwen2.5-VL-3B-Instruct, Training Stage=SFT2026.07 | 4.8 | 19 | |
| VL-Rethinker-32BArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=Zero-shot2026.07 | 3.6 | 7.2 | |
| VL-Rethinker-7BArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=Zero-shot2026.07 | 3.2 | 3.2 | |
| MultiArchitecture=Qwen3-VL-4B-Instruct, Training Stage=Zero-shot2026.07 | 2.4 | 5.6 | |
| MultiArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=Zero-shot2026.07 | 2 | 1.4 | |
| SingleArchitecture=Qwen3-VL-4B-Instruct, Training Stage=Zero-shot2026.07 | 2 | 2.2 | |
| SingleArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=Zero-shot2026.07 | 1.6 | 1.4 |