General Reasoning Performance on Aggregate (MATH-500, AIME24, AIME25, GPQA-diamond)
71.49AccuracyMUR
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MURBackbone=Qwen3-8B, Reasoning Mode=Thinking Mode2025.07 | 71.49 | 0.39 | 10,918 | 1.4 | |
| Per-Step ScaleBackbone=Qwen3-8B, Reasoning Mode=Thinking Mode2025.07 | 71.1 | — | 10,767 | — | |
| Avg uncertaintyBackbone=Qwen3-8B, Reasoning Mode=Thinking Mode2025.07 | 69.23 | -1.87 | 11,259 | 4.57 | |
| MURBackbone=Qwen3-4B, Reasoning Mode=Thinking Mode2025.07 | 69.1 | 2.12 | 9,393 | -10.64 | |
| Avg uncertaintyBackbone=Qwen3-4B, Reasoning Mode=Thinking Mode2025.07 | 68.72 | 1.74 | 10,593 | 0.76 | |
| SMARTBackbone=Qwen3-4B, Reasoning Mode=Thinking Mode2025.07 | 68.71 | 1.72 | 11,548 | 9.85 | |
| SMARTBackbone=Qwen3-8B, Reasoning Mode=Thinking Mode2025.07 | 67.7 | -3.4 | 12,784 | 18.73 | |
| Per-Step ScaleBackbone=Qwen3-4B, Reasoning Mode=Thinking Mode2025.07 | 66.98 | — | 10,512 | — | |
| MURBackbone=Qwen3-1.7B, Reasoning Mode=Thinking Mode2025.07 | 52.02 | 2.74 | 10,421 | -9.67 | |
| Avg uncertaintyBackbone=Qwen3-1.7B, Reasoning Mode=Thinking Mode2025.07 | 51.53 | 2.25 | 10,942 | -5.15 | |
| SMARTBackbone=Qwen3-1.7B, Reasoning Mode=Thinking Mode2025.07 | 51.16 | 1.88 | 11,810 | 2.37 | |
| Per-Step ScaleBackbone=Qwen3-1.7B, Reasoning Mode=Thinking Mode2025.07 | 49.28 | — | 11,536 | — | |
| Non-Thinking ModeBackbone=Qwen3-8B, Reasoning Mode=Non-Thinking Mode2025.07 | 43.56 | — | 2,212 | — | |
| Non-Thinking ModeBackbone=Qwen3-4B, Reasoning Mode=Non-Thinking Mode2025.07 | 40.03 | — | 1,768 | — | |
| Vanilla CoTBackbone=Qwen3-1.7B, Reasoning Mode=Non-Thinking Mode2025.07 | 30.74 | — | 2,662 | — |