Mathematical Reasoning on AIME 25 (A25 Score)
62.3A25 ScoreGEAR
Evaluation Results
| Method | Links | |
|---|---|---|
| GEARBackbone=Qwen3-4B, Evaluation Context=Multi-Domain Generalization2026.05 | 62.3 | |
| GEARBackbone=Qwen3-8B, Evaluation Context=Standard2026.05 | 54.2 | |
| GEARBackbone=Qwen3-4B, Evaluation Context=Standard2026.05 | 53.4 | |
| GRPOBackbone=Qwen3-4B, Evaluation Context=Multi-Domain Generalization2026.05 | 52.5 | |
| BaseBackbone=Qwen3-8B, Evaluation Context=Standard2026.05 | 52.3 | |
| BaseBackbone=Qwen3-4B, Evaluation Context=Standard2026.05 | 51.2 | |
| ARPOBackbone=Qwen3-4B, Evaluation Context=Standard2026.05 | 48.9 | |
| ARPOBackbone=Qwen3-8B, Evaluation Context=Standard2026.05 | 47.8 | |
| GRPOBackbone=Qwen3-4B, Evaluation Context=Standard2026.05 | 47.4 | |
| GRPOBackbone=Qwen3-8B, Evaluation Context=Standard2026.05 | 46.3 | |
| OPSD+RLBackbone=Qwen3-4B, Evaluation Context=Standard2026.05 | 45.8 | |
| MT-GRPOBackbone=Qwen3-4B, Evaluation Context=Standard2026.05 | 45.6 | |
| MT-GRPOBackbone=Qwen3-8B, Evaluation Context=Standard2026.05 | 44.6 | |
| OPSD+RLBackbone=Qwen3-8B, Evaluation Context=Standard2026.05 | 44.5 | |
| OPSDBackbone=Qwen3-4B, Evaluation Context=Standard2026.05 | 42.1 | |
| OPSDBackbone=Qwen3-8B, Evaluation Context=Standard2026.05 | 34.7 |