Reasoning on Average (MATH500, AIME24, AIME25, GPQA_diamond)
58.71AccuracyInftyThink+
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| InftyThink+Base Model=Qwen3-4B-Base, RL Setting=Task reward only2026.02 | 58.71 | 15.69 | 265.17 | — | — | |
| VanillaBase Model=Qwen3-4B-Base, RL Setting=Task reward only2026.02 | 57.13 | 13.63 | 534.57 | — | — | |
| InftyThink+Base Model=Qwen3-4B-Base, RL Setting=Task + efficiency reward used2026.02 | 56.66 | 10.32 | 154.62 | — | — | |
| MURBackbone=Qwen3-30B-A3B, Search Strategy=Guided search2025.07 | 54.36 | 14,457 | — | 6.44 | -53.21 | |
| InftyThink+Base Model=DeepSeek-R1-Distill-Qwen-1.5B, RL Setting=Task reward only2026.02 | 53.96 | 20.02 | 100.21 | — | — | |
| VanillaBase Model=Qwen3-4B-Base, RL Setting=Cold start only (No RL)2026.02 | 53.83 | 10.64 | 320.73 | — | — | |
| InftyThink+Base Model=Qwen3-4B-Base, RL Setting=Cold start only (No RL)2026.02 | 53.67 | 11.35 | 186.3 | — | — | |
| InftyThink+Base Model=DeepSeek-R1-Distill-Qwen-1.5B, RL Setting=Task + efficiency reward used2026.02 | 50.58 | 10.66 | 48.37 | — | — | |
| MURBackbone=Qwen3-8B, Search Strategy=phi-Decoding2025.07 | 48.23 | 12,120 | — | 3.46 | -46.4 | |
| MURBackbone=Qwen3-8B, Search Strategy=Guided search2025.07 | 48.17 | 5,318 | — | 1.38 | -57.21 | |
| VanillaBase Model=DeepSeek-R1-Distill-Qwen-1.5B, RL Setting=Task reward only2026.02 | 47.31 | 14.45 | 149.44 | — | — | |
| MURBackbone=Qwen3-8B, Search Strategy=LLM as a critic2025.07 | 46.36 | 2,975 | — | 0.84 | 0.34 | |
| InftyThink+Base Model=DeepSeek-R1-Distill-Qwen-1.5B, RL Setting=Cold start only (No RL)2026.02 | 44.06 | 14.24 | 77.57 | — | — | |
| Vanilla CoTBackbone=Qwen3-30B-A3B2025.07 | 43.5 | 1,868 | — | — | — | |
| MURBackbone=Qwen3-4B, Search Strategy=Guided search2025.07 | 43.02 | 3,295 | — | 0.33 | -57.47 | |
| MURBackbone=Qwen3-4B, Search Strategy=LLM as a critic2025.07 | 42.19 | 1,967 | — | 0.98 | -2.98 | |
| MURBackbone=Qwen3-4B, Search Strategy=phi-Decoding2025.07 | 41.74 | 5,037 | — | 1.3 | -46.21 | |
| VanillaBase Model=DeepSeek-R1-Distill-Qwen-1.5B, RL Setting=Cold start only (No RL)2026.02 | 41.69 | 12.1 | 110.96 | — | — | |
| MURBackbone=Qwen3-1.7B, Search Strategy=LLM as a critic2025.07 | 33.28 | 2,625 | — | 2.15 | 26.25 | |
| MURBackbone=Qwen3-1.7B, Search Strategy=Guided search2025.07 | 33.25 | 3,304 | — | 1.65 | -70.19 | |
| MURBackbone=Qwen3-1.7B, Search Strategy=phi-Decoding2025.07 | 31.72 | 8,537 | — | 1.66 | -35.48 | |
| MURBackbone=GLM-4-9B, Search Strategy=LLM as a critic2025.07 | 29.92 | 5,199 | — | 3.64 | -19.13 |