Mathematical Reasoning on AIME24 (A24 Score)
53.3A24 ScoreGEAR
Evaluation Results
| Method | Links | |
|---|---|---|
| GEARBackbone=Qwen3-4B, Evaluation Context=Multi-Domain Generalization2026.05 | 53.3 | |
| GEARBackbone=Qwen3-8B, Evaluation Context=Standard2026.05 | 51.4 | |
| GEARBackbone=Qwen3-4B, Evaluation Context=Standard2026.05 | 50.3 | |
| ARPOBackbone=Qwen3-8B, Evaluation Context=Standard2026.05 | 47.9 | |
| BaseBackbone=Qwen3-8B, Evaluation Context=Standard2026.05 | 47.1 | |
| OPSD+RLBackbone=Qwen3-8B, Evaluation Context=Standard2026.05 | 47.1 | |
| GRPOBackbone=Qwen3-8B, Evaluation Context=Standard2026.05 | 46.5 | |
| ARPOBackbone=Qwen3-4B, Evaluation Context=Standard2026.05 | 46.3 | |
| BaseBackbone=Qwen3-4B, Evaluation Context=Standard2026.05 | 45.8 | |
| MT-GRPOBackbone=Qwen3-8B, Evaluation Context=Standard2026.05 | 45.5 | |
| GRPOBackbone=Qwen3-4B, Evaluation Context=Multi-Domain Generalization2026.05 | 45.3 | |
| GRPOBackbone=Qwen3-4B, Evaluation Context=Standard2026.05 | 43.1 | |
| MT-GRPOBackbone=Qwen3-4B, Evaluation Context=Standard2026.05 | 42.3 | |
| OPSD+RLBackbone=Qwen3-4B, Evaluation Context=Standard2026.05 | 39.6 | |
| OPSDBackbone=Qwen3-8B, Evaluation Context=Standard2026.05 | 38.1 | |
| OPSDBackbone=Qwen3-4B, Evaluation Context=Standard2026.05 | 36.3 |