Mathematical Reasoning on AIME 24 (Pass@1, TC)
26.7Pass@1 ScoreEAPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EAPOBackbone=Llama3.1-8B-Instruct2026.06 | 26.7 | 1 | |
| DAPOBase Model=Qwen-2.5 Math-7B2026.06 | 16.7 | — | |
| DAPO (WITH FORKING TOKENS)Base Model=Qwen-2.5 Math-7B2026.06 | 16.7 | — | |
| S-GRPOBase Model=Qwen-2.5 Math-7B2026.06 | 16.7 | — | |
| PS-PPO (OPTIMIZED, B=128)Base Model=Qwen-2.5 Math-7B2026.06 | 16.7 | — | |
| Reinforce++Backbone=Llama3.1-8B-Instruct2026.06 | 13.3 | 1.08 | |
| GRPOBase Model=Qwen-2.5 Math-7B2026.06 | 13.3 | — | |
| DR.GRPOBase Model=Qwen-2.5 Math-7B2026.06 | 13.3 | — | |
| PS-PPO (UNIFORM)Base Model=Qwen-2.5 Math-7B2026.06 | 13.3 | — | |
| PS-PPO (HEURISTIC)Base Model=Qwen-2.5 Math-7B2026.06 | 13.3 | — | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.06 | 10 | 1.02 | |
| DAPOBase Model=Llama-3.1 8B-Instruct2026.06 | 10 | — | |
| DAPO (WITH FORKING TOKENS)Base Model=Llama-3.1 8B-Instruct2026.06 | 10 | — | |
| S-GRPOBase Model=Llama-3.1 8B-Instruct2026.06 | 10 | — | |
| PS-PPO (OPTIMIZED, B=128)Base Model=Llama-3.1 8B-Instruct2026.06 | 10 | — | |
| RLOOBase Model=Qwen-2.5 Math-7B2026.06 | 10 | — | |
| FIXED LENGTH (L=512)Base Model=Qwen-2.5 Math-7B2026.06 | 10 | — | |
| PS-PPO (TIME-PRIOR)Base Model=Qwen-2.5 Math-7B2026.06 | 10 | — | |
| GRPOBase Model=Llama-3.1 8B-Instruct2026.06 | 6.6 | — | |
| DR.GRPOBase Model=Llama-3.1 8B-Instruct2026.06 | 6.6 | — | |
| RLOOBase Model=Llama-3.1 8B-Instruct2026.06 | 6.6 | — | |
| FIXED LENGTH (L=512)Base Model=Llama-3.1 8B-Instruct2026.06 | 6.6 | — | |
| PS-PPO (UNIFORM)Base Model=Llama-3.1 8B-Instruct2026.06 | 6.6 | — | |
| PS-PPO (TIME-PRIOR)Base Model=Llama-3.1 8B-Instruct2026.06 | 6.6 | — | |
| PS-PPO (HEURISTIC)Base Model=Llama-3.1 8B-Instruct2026.06 | 6.6 | — | |
| BASEBase Model=Qwen-2.5 Math-7B2026.06 | 6.6 | — | |
| TIRBackbone=Llama3.1-8B-Instruct2026.06 | 3.3 | 0.52 | |
| BASEBase Model=Llama-3.1 8B-Instruct2026.06 | 3.3 | — | |
| BaseBackbone=Llama3.1-8B-Instruct2026.06 | 0 | — |