Math Reasoning on AIME 24 (Accuracy)
83.3AccuracyBaseline
Evaluation Results
| Method | Links | |
|---|---|---|
| BaselineSparsity=0%2025.11 | 83.3 | |
| PuzzleMoESparsity=25%2025.11 | 71.1 | |
| VRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=VRPO2025.08 | 46.67 | |
| Reinforce++Model Backbone=Qwen3-8B(Strong Model), Optimization Method=Reinforce++2025.08 | 45 | |
| Dr.GRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=Dr.GRPO2025.08 | 45 | |
| BaseModel Backbone=Qwen3-8B(Strong Model), Optimization Method=Base2025.08 | 41.67 | |
| PPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=PPO2025.08 | 36.67 | |
| GRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=GRPO2025.08 | 35 | |
| EGLR-OracleLModel=Qwen2.5-Math-7B-Instruct2026.06 | 30 | |
| EGLR-OracleLModel=Qwen2.5-14B-Instruct2026.06 | 26.7 | |
| VRPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=VRPO2025.08 | 23.33 | |
| EGLR-OracleLModel=Qwen2.5-7B-Instruct2026.06 | 23.3 | |
| EGLR-OracleLModel=Llama-3.1-8B-Instruct2026.06 | 23.3 | |
| CFTTeacher Model=S1.1-32B2025.05 | 20 | |
| CGDTeacher Model=Claude Sonnet 3.72025.05 | 20 | |
| EGLR-OracleLModel=Qwen2.5-3B-Instruct2026.06 | 20 | |
| EGLR (best L)Model=Qwen2.5-14B-Instruct2026.06 | 20 | |
| EGLR-SCL (B = 10)Model=Qwen2.5-14B-Instruct2026.06 | 20 | |
| EGLR-OracleLModel=Qwen2.5-Math-1.5B-Instruct2026.06 | 20 | |
| EGLR (best L)Model=Qwen2.5-Math-7B-Instruct2026.06 | 20 | |
| CFTTeacher Model=GPT-4o2025.05 | 16.7 | |
| EGLR-SCL (B = 10)Model=Qwen2.5-3B-Instruct2026.06 | 16.7 | |
| EGLR (best L)Model=Qwen2.5-7B-Instruct2026.06 | 16.7 | |
| EGLR-SCL (B = 10)Model=Qwen2.5-7B-Instruct2026.06 | 16.7 | |
| PPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=PPO2025.08 | 13.33 | |
| Dr.GRPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Dr.GRPO2025.08 | 13.33 | |
| CGDTeacher Model=S1.1-32B2025.05 | 13.3 | |
| EGLR (best L)Model=Qwen2.5-3B-Instruct2026.06 | 13.3 | |
| GreedyModel=Qwen2.5-Math-1.5B-Instruct2026.06 | 13.3 | |
| EGLR (best L)Model=Qwen2.5-Math-1.5B-Instruct2026.06 | 13.3 | |
| GreedyModel=Qwen2.5-Math-7B-Instruct2026.06 | 13.3 | |
| EGLR-SCL (B = 10)Model=Qwen2.5-Math-7B-Instruct2026.06 | 13.3 | |
| EGLR (best L)Model=Llama-3.1-8B-Instruct2026.06 | 13.3 | |
| Qwen2.5-Math-7B (Base)2025.05 | 10 | |
| GreedyModel=Qwen2.5-14B-Instruct2026.06 | 10 | |
| EGLR-SCL (B = 10)Model=Qwen2.5-Math-1.5B-Instruct2026.06 | 10 | |
| EGLR-SCL (B = 10)Model=Llama-3.1-8B-Instruct2026.06 | 10 | |
| GreedyModel=Qwen2.5-3B-Instruct2026.06 | 6.7 | |
| GreedyModel=Qwen2.5-7B-Instruct2026.06 | 6.7 | |
| BaseModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Base2025.08 | 6.67 | |
| GRPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=GRPO2025.08 | 6.67 | |
| Reinforce++Model Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Reinforce++2025.08 | 6.67 | |
| EGLR (best L)Model=Qwen2.5-0.5B-Instruct2026.06 | 3.3 | |
| EGLR-SCL (B = 10)Model=Qwen2.5-0.5B-Instruct2026.06 | 3.3 | |
| EGLR-OracleLModel=Qwen2.5-0.5B-Instruct2026.06 | 3.3 | |
| GreedyModel=Mistral-7B-Instruct-v0.32026.06 | 3.3 | |
| EGLR (best L)Model=Mistral-7B-Instruct-v0.32026.06 | 3.3 | |
| EGLR-SCL (B = 10)Model=Mistral-7B-Instruct-v0.32026.06 | 3.3 | |
| EGLR-OracleLModel=Mistral-7B-Instruct-v0.32026.06 | 3.3 | |
| GreedyModel=Qwen2.5-0.5B-Instruct2026.06 | 0 | |
| GreedyModel=Llama-3.1-8B-Instruct2026.06 | 0 | |
| HC-SMoESparsity=25%2025.11 | 0 |