Problem Solving and Unsolvability Detection on Maze Hard
98Solvable AccuracyDeepseek-V3.2-R
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Deepseek-V3.2-RModel Scale=V3.2-R2025.12 | 98 | 98 | 98 | |
| Gemini-3Model Scale=32025.12 | 96 | 91 | 93.5 | |
| GPT-5.1-LowModel Scale=5.1-Low2025.12 | 86 | 94 | 90 | |
| Qwen3-4B + UnsolvableRLModel Scale=4B, Training Protocol=UnsolvableRL2025.12 | 65.8 | 89 | 77.9 | |
| Qwen3-4B InstructModel Scale=4B, Training Protocol=Instruct2025.12 | 13.3 | 64.5 | 38.9 | |
| Qwen3-1.7B InstructModel Scale=1.7B, Training Protocol=Instruct2025.12 | 0 | 80 | 40 | |
| Qwen3-1.7B + UnsolvableRLModel Scale=1.7B, Training Protocol=UnsolvableRL2025.12 | 0 | 79 | 39.5 |