Mathematical Reasoning on AIME 25 (Pass@1, TC)
20Pass@1 AccuracyEAPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EAPOBackbone=Llama3.1-8B-Instruct2026.06 | 20 | 0.96 | |
| Reinforce++Backbone=Llama3.1-8B-Instruct2026.06 | 16.7 | 1.1 | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.06 | 13.3 | 1.27 | |
| PS-PPO (OPTIMIZED, B=128)Base Model=Qwen-2.5 Math-7B2026.06 | 13.3 | — | |
| GRPOBase Model=Qwen-2.5 Math-7B2026.06 | 10 | — | |
| DR.GRPOBase Model=Qwen-2.5 Math-7B2026.06 | 10 | — | |
| DAPOBase Model=Qwen-2.5 Math-7B2026.06 | 10 | — | |
| DAPO (WITH FORKING TOKENS)Base Model=Qwen-2.5 Math-7B2026.06 | 10 | — | |
| S-GRPOBase Model=Qwen-2.5 Math-7B2026.06 | 10 | — | |
| PS-PPO (HEURISTIC)Base Model=Qwen-2.5 Math-7B2026.06 | 10 | — | |
| PS-PPO (UNIFORM)Base Model=Qwen-2.5 Math-7B2026.06 | 9 | — | |
| FIXED LENGTH (L=512)Base Model=Qwen-2.5 Math-7B2026.06 | 8.9 | — | |
| BASEBase Model=Qwen-2.5 Math-7B2026.06 | 6.7 | — | |
| RLOOBase Model=Qwen-2.5 Math-7B2026.06 | 6.7 | — | |
| PS-PPO (TIME-PRIOR)Base Model=Qwen-2.5 Math-7B2026.06 | 6.7 | — | |
| BaseBackbone=Llama3.1-8B-Instruct2026.06 | 3.3 | — | |
| TIRBackbone=Llama3.1-8B-Instruct2026.06 | 3.3 | 0.73 | |
| DR.GRPOBase Model=Llama-3.1 8B-Instruct2026.06 | 3.3 | — | |
| DAPOBase Model=Llama-3.1 8B-Instruct2026.06 | 3.3 | — | |
| DAPO (WITH FORKING TOKENS)Base Model=Llama-3.1 8B-Instruct2026.06 | 3.3 | — | |
| S-GRPOBase Model=Llama-3.1 8B-Instruct2026.06 | 3.3 | — | |
| PS-PPO (OPTIMIZED, B=128)Base Model=Llama-3.1 8B-Instruct2026.06 | 3.3 | — | |
| PS-PPO (UNIFORM)Base Model=Llama-3.1 8B-Instruct2026.06 | 1.1 | — | |
| PS-PPO (TIME-PRIOR)Base Model=Llama-3.1 8B-Instruct2026.06 | 1.1 | — | |
| PS-PPO (HEURISTIC)Base Model=Llama-3.1 8B-Instruct2026.06 | 1.1 | — | |
| BASEBase Model=Llama-3.1 8B-Instruct2026.06 | 0 | — | |
| GRPOBase Model=Llama-3.1 8B-Instruct2026.06 | 0 | — | |
| RLOOBase Model=Llama-3.1 8B-Instruct2026.06 | 0 | — | |
| FIXED LENGTH (L=512)Base Model=Llama-3.1 8B-Instruct2026.06 | 0 | — |