General-domain reasoning on SuperGPQA, MMLU-Pro, and BBEH
40.75Overall Avg ScoreR-Diverse
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| R-DiverseBackbone=Qwen3-8B-Base, Training Iterations=52026.02 | 40.75 | 32.52 | 61.79 | 12.23 | |
| R-Diverse*Backbone=Qwen3-8B-Base, Training Iterations=32026.02 | 40.34 | 32.56 | 61.49 | 11.92 | |
| Socratic-ZeroBackbone=Qwen3-8B-Base, Training Iterations=32026.02 | 39.15 | 30.1 | 60.9 | 9.5 | |
| Absolute ZeroBackbone=Qwen3-8B-Base, Training Iterations=32026.02 | 38.97 | 31.89 | 60.5 | 10.8 | |
| R-ZeroBackbone=Qwen3-8B-Base, Training Iterations=32026.02 | 38.73 | 31.38 | 58.23 | 10.6 | |
| R-DiverseBackbone=Qwen3-4B-Base, Training Iterations=52026.02 | 36.68 | 28.54 | 55.24 | 10.35 | |
| R-Diverse*Backbone=Qwen3-4B-Base, Training Iterations=32026.02 | 36.3 | 28.84 | 54.91 | 10.77 | |
| R-ZeroBackbone=Qwen3-4B-Base, Training Iterations=32026.02 | 34.64 | 27.55 | 51.53 | 10.42 | |
| R-ZeroBackbone=Qwen3-8B-Base, Variant=Proposed method2025.08 | 34.5 | 31.38 | 61.53 | 10.6 | |
| Base ModelBackbone=Qwen3-8B-Base2026.02 | 34.49 | 28.33 | 51.8 | 8.63 | |
| Absolute ZeroBackbone=Qwen3-8B-Base2025.08 | 34.4 | 31.89 | 60.5 | 10.8 | |
| SPIRALBackbone=Qwen3-4B-Base, Training Iterations=32026.02 | 34.22 | 27.1 | 53.2 | 9.57 | |
| Absolute ZeroBackbone=Qwen3-4B-Base, Training Iterations=32026.02 | 33.61 | 27.1 | 52.6 | 8.3 | |
| Base ModelBackbone=Qwen3-8B-Base, Training Mode=w/o training2025.08 | 31.98 | 28.33 | 58.97 | 8.63 | |
| R-Zero (challenger)Backbone=Qwen3-8B-Base, Variant=Challenger baseline2025.08 | 31.29 | 30.12 | 54.14 | 9.6 | |
| R-ZeroBackbone=Qwen3-4B-Base, Variant=Proposed method2025.08 | 31.15 | 27.55 | 55.47 | 10.42 | |
| Absolute ZeroBackbone=Qwen3-4B-Base2025.08 | 29.33 | 27.1 | 52.6 | 8.3 | |
| R-Zero (challenger)Backbone=Qwen3-4B-Base, Variant=Challenger baseline2025.08 | 28.52 | 24.77 | 54.2 | 6.59 | |
| Base ModelBackbone=Qwen3-4B-Base2026.02 | 27.1 | 20.88 | 37.38 | 7.57 | |
| Base ModelBackbone=Qwen3-4B-Base, Training Mode=w/o training2025.08 | 26.34 | 20.88 | 50.58 | 7.57 | |
| R-ZeroBackbone=OctoThinker-8B, Variant=Proposed method2025.08 | 23 | 19.82 | 40.92 | 8.25 | |
| R-Zero (challenger)Backbone=OctoThinker-8B, Variant=Challenger baseline2025.08 | 21.3 | 16.99 | 41.46 | 5.46 | |
| Absolute ZeroBackbone=OctoThinker-8B2025.08 | 18.4 | 18.8 | 31.4 | 5 | |
| Absolute ZeroBackbone=OctoThinker-3B2025.08 | 16.03 | 17.7 | 24.3 | 6.1 | |
| Base ModelBackbone=OctoThinker-8B, Training Mode=w/o training2025.08 | 11.7 | 13.26 | 20.21 | 1.64 | |
| R-ZeroBackbone=OctoThinker-3B, Variant=Proposed method2025.08 | 11.12 | 12.44 | 16.71 | 4.2 | |
| R-Zero (challenger)Backbone=OctoThinker-3B, Variant=Challenger baseline2025.08 | 10.04 | 11.19 | 14.53 | 4.4 | |
| Base ModelBackbone=OctoThinker-3B, Training Mode=w/o training2025.08 | 7.47 | 10.09 | 10.87 | 1.46 |