Mathematical Reasoning on AIME 24 (Accuracy (%))
74.3AccuracyELPO-4B
Evaluation Results
| Method | Links | |
|---|---|---|
| ELPO-4BStarting Checkpoint=Inst, Backbone Architecture Family=Qwen3-4B2026.02 | 74.3 | |
| DemyAgent-4BStarting Checkpoint=Inst, Backbone Architecture Family=Qwen3-4B2026.02 | 72.6 | |
| Qwen3-4BStarting Checkpoint=Inst, Reasoning Strategy=Self-Contained Reasoning, Backbone Architecture Family=Qwen3-4B2026.02 | 63.3 | |
| ELPO-7BStarting Checkpoint=Inst, Optimization/RL Method Category=Agentic RL, Backbone Architecture Family=Qwen2.5-7B2026.02 | 48.1 | |
| DemyAgentStarting Checkpoint=Inst, Optimization/RL Method Category=Agentic RL, Backbone Architecture Family=Qwen2.5-7B2026.02 | 43.2 | |
| CIRStarting Checkpoint=Math, Optimization/RL Method Category=Agentic RL, Backbone Architecture Family=Qwen2.5-7B2026.02 | 42.3 | |
| ToRLStarting Checkpoint=Math-Inst, Optimization/RL Method Category=Agentic RL, Backbone Architecture Family=Qwen2.5-7B2026.02 | 40.2 | |
| DeepSeek-V3Starting Checkpoint=Base, Reasoning Strategy=Self-Contained Reasoning, Backbone Architecture Family=DeepSeek-V32026.02 | 39.2 | |
| AEPOStarting Checkpoint=Inst, Optimization/RL Method Category=Agentic RL, Backbone Architecture Family=Qwen2.5-7B2026.02 | 33.3 | |
| ARPOStarting Checkpoint=Inst, Optimization/RL Method Category=Agentic RL, Backbone Architecture Family=Qwen2.5-7B2026.02 | 30 | |
| GIGPOStarting Checkpoint=Inst, Optimization/RL Method Category=Agentic RL, Backbone Architecture Family=Qwen2.5-7B2026.02 | 30 | |
| Reinforce++Starting Checkpoint=Instruct, Optimization/RL Method Category=Classical RL, Backbone Architecture Family=Qwen2.5-7B2026.02 | 26.7 | |
| GRPOStarting Checkpoint=Inst, Optimization/RL Method Category=Classical RL, Backbone Architecture Family=Qwen2.5-7B2026.02 | 23.3 | |
| DAPOStarting Checkpoint=Instruct, Optimization/RL Method Category=Clipping-optimized RL, Backbone Architecture Family=Qwen2.5-7B2026.02 | 20 | |
| Qwen3-4BStarting Checkpoint=Inst, Reasoning Strategy=TIR Reasoning, Backbone Architecture Family=Qwen3-4B2026.02 | 17 | |
| Qwen2.5-7BStarting Checkpoint=Inst, Reasoning Strategy=Self-Contained Reasoning, Backbone Architecture Family=Qwen2.5-7B2026.02 | 16.7 | |
| Qwen2.5-7BStarting Checkpoint=Inst, Reasoning Strategy=TIR Reasoning, Backbone Architecture Family=Qwen2.5-7B2026.02 | 6.7 |