Puzzle Reasoning on FrozenLake
82Success Rateo4-mini
Evaluation Results
| Method | Links | |
|---|---|---|
| o4-mini2026.05 | 82 | |
| Claude 4.5 Sonnet2026.05 | 80 | |
| GLANCE-FullBackbone=Qwen2.5-VL-3B, Reward Strategy=Dense Extrinsic, Reasoning Strategy=World Model Reasoning for Visual States2026.05 | 78 | |
| Gemini 2.5 Pro2026.05 | 78 | |
| GLANCE-BaseBackbone=Qwen2.5-VL-3B, Reward Strategy=Sparse Extrinsic, Reasoning Strategy=World Model Reasoning Strategy2026.05 | 73 | |
| VAGEN-FullBackbone=Qwen2.5-VL-3B, Reward Strategy=Dense Extrinsic, Reasoning Strategy=World Model Reasoning for Visual States2026.05 | 72 | |
| VAGEN-BaseBackbone=Qwen2.5-VL-3B, Reward Strategy=Sparse Extrinsic, Reasoning Strategy=World Model Reasoning Strategy2026.05 | 71 | |
| GLANCE w/ Turn-PPOBackbone=Qwen2.5-VL-3B, Reward Strategy=Turn-level PPO, Reasoning Strategy=World Model Reasoning Strategy2026.05 | 70 | |
| Claude 3.7 Sonnet2026.05 | 69 | |
| Turn-PPO w/ MaskBackbone=Qwen2.5-VL-3B, Reward Strategy=Turn-level PPO, Reasoning Strategy=World Model Reasoning Strategy2026.05 | 68 | |
| GRPO w/ MaskBackbone=Qwen2.5-VL-3B, Reward Strategy=RL Baseline, Reasoning Strategy=World Model Reasoning Strategy2026.05 | 57 | |
| GPT-4o2026.05 | 54 | |
| Qwen2.5-VL-72BBackbone=Qwen2.5-VL-72B2026.05 | 44 | |
| Vanilla-PPOBackbone=Qwen2.5-VL-3B, Reward Strategy=RL Baseline, Reasoning Strategy=World Model Reasoning Strategy2026.05 | 21 | |
| VLM-R1-3BBackbone=VLM-R1-3B2026.05 | 15 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2026.05 | 14 | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B2026.05 | 14 |