Mathematical Reasoning on AIME25 (pass@1, pass@16)
33.54Pass@1OWPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OWPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 33.54 | — | |
| OWPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 31.67 | — | |
| DAPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 30.63 | — | |
| MOPDBase Model=Qwen-3-8B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 29.38 | — | |
| OPDBase Model=Qwen-3-8B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 27.81 | — | |
| DAPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 27.39 | — | |
| MOPDBase Model=Qwen-3-8B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 27.19 | — | |
| Sym-DAPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 26.88 | — | |
| OPDBase Model=Qwen-3-8B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 26.56 | — | |
| Sym-DAPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 24.79 | — | |
| GRPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 23.54 | — | |
| EVOL-RLBase Model Size=8B, Training Dataset=MATH-TRAIN2025.09 | 21.6 | 43.1 | |
| GRPOBase Model=Qwen-3-8B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 20.42 | — | |
| EVOL-RLBase Model Size=8B, Training Dataset=MATH-5002025.09 | 20.2 | 44.4 | |
| DAPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 18.75 | — | |
| OWPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 18.44 | — | |
| OWPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 17.92 | — | |
| EVOL-RLBase Model Size=4B, Training Dataset=MATH-TRAIN2025.09 | 17.5 | 39.9 | |
| EVOL-RLBase Model Size=4B, Training Dataset=AIME242025.09 | 17.1 | 42 | |
| MOPDBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 16.98 | — | |
| OPDBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 16.56 | — | |
| TTRLBase Model Size=8B, Training Dataset=MATH-5002025.09 | 16.5 | 34.3 | |
| EVOL-RLBase Model Size=8B, Training Dataset=AIME242025.09 | 16.5 | 34.7 | |
| EVOL-RLBase Model Size=4B, Training Dataset=MATH-5002025.09 | 16.1 | 41.9 | |
| Sym-DAPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 16.04 | — | |
| MOPDBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 15.93 | — | |
| Sym-DAPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 15.63 | — | |
| DAPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 15.62 | — | |
| TTRLBase Model Size=8B, Training Dataset=MATH-TRAIN2025.09 | 15.6 | 35.9 | |
| OPDBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 15.21 | — | |
| GRPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=converged, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 12.6 | — | |
| GRPOBase Model=Qwen-2.5-Math-7B-Base, Checkpoint Selection=best, Evaluation Protocol=k=32 samples per problem (Average@32)2026.05 | 11.77 | — | |
| TTRLBase Model Size=8B, Training Dataset=AIME242025.09 | 11.4 | 25.4 | |
| Qwen3-8B-BaseBase Model Size=8B, Training Dataset=-2025.09 | 8.2 | 30.8 | |
| TTRLBase Model Size=4B, Training Dataset=MATH-5002025.09 | 7.2 | 29.9 | |
| TTRLBase Model Size=4B, Training Dataset=MATH-TRAIN2025.09 | 6.8 | 28.6 | |
| Qwen3-4B-BaseBase Model Size=4B, Training Dataset=-2025.09 | 5.5 | 30 | |
| TTRLBase Model Size=4B, Training Dataset=AIME242025.09 | 4.6 | 18.5 |