Spatial Navigation on Spatial Navigation (ID)
93.6Average ScoreReflection Tuning
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Reflection TuningArchitecture=Qwen3-VL-4B-Instruct, Training Stage=SFT2026.07 | 93.6 | — | |
| Single-SFT → GRPOArchitecture=Qwen3-VL-4B-Instruct, Training Stage=RL2026.07 | 93.2 | — | |
| Single-SFTArchitecture=Qwen3-VL-4B-Instruct, Training Stage=SFT2026.07 | 90.7 | — | |
| VRRLArchitecture=Qwen3-VL-4B-Instruct, Training Stage=RL2026.07 | 89.1 | — | |
| Base*Architecture=Qwen3-VL-4B-Instruct, Training Stage=SFT2026.07 | 88.1 | — | |
| Multi-SFT → GRPOArchitecture=Qwen3-VL-4B-Instruct, Training Stage=RL2026.07 | 87.9 | — | |
| Multi-SFTArchitecture=Qwen3-VL-4B-Instruct, Training Stage=SFT2026.07 | 86.9 | — | |
| Single-SFT → GRPOArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=RL2026.07 | 85.9 | 49.2 | |
| Reflection TuningArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=SFT2026.07 | 85.7 | 49.6 | |
| Multi-SFT → GRPOArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=RL2026.07 | 85.2 | 42.8 | |
| VRRLArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=RL2026.07 | 83.9 | 54.8 | |
| Single-SFTArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=SFT2026.07 | 83.5 | 39.2 | |
| Multi-SFTArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=SFT2026.07 | 81.2 | 41.6 | |
| Base*Architecture=Qwen2.5-VL-3B-Instruct, Training Stage=SFT2026.07 | 77.7 | 33.2 | |
| MultiArchitecture=Qwen3-VL-4B-Instruct, Training Stage=Zero-shot2026.07 | 34 | — | |
| VL-Rethinker-32BArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=Zero-shot2026.07 | 26.5 | 10.8 | |
| VL-Rethinker-7BArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=Zero-shot2026.07 | 11.3 | 3.2 | |
| SingleArchitecture=Qwen3-VL-4B-Instruct, Training Stage=Zero-shot2026.07 | 8.4 | — | |
| MultiArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=Zero-shot2026.07 | 2.8 | 0.8 | |
| SingleArchitecture=Qwen2.5-VL-3B-Instruct, Training Stage=Zero-shot2026.07 | 2.4 | 1.2 |