Problem Solving and Unsolvability Detection on AIME 24-25
95Solvable AccuracyGemini-3
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Gemini-3Model Scale=32025.12 | 95 | 21.2 | 58.1 | |
| Deepseek-V3.2-RModel Scale=V3.2-R2025.12 | 85 | 40.3 | 62.7 | |
| Qwen3-4B + UnsolvableRLModel Scale=4B, Training Protocol=UnsolvableRL2025.12 | 69.6 | 40.4 | 55 | |
| Qwen3-4B InstructModel Scale=4B, Training Protocol=Instruct2025.12 | 67.9 | 14.8 | 41.4 | |
| GPT-5.1-LowModel Scale=5.1-Low2025.12 | 61.7 | 42.5 | 52.1 | |
| Qwen3-1.7B InstructModel Scale=1.7B, Training Protocol=Instruct2025.12 | 38.3 | 21.2 | 29.8 | |
| Qwen3-1.7B + UnsolvableRLModel Scale=1.7B, Training Protocol=UnsolvableRL2025.12 | 35.4 | 28.7 | 32.1 |