Mathematical Reasoning on Average Six Benchmarks
68.66AccuracySTAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| STAPOBase Model=Qwen3-14B, Evaluation Setting=JustRL2026.02 | 68.66 | |
| JustRLBase Model=Qwen3-14B, Evaluation Setting=JustRL2026.02 | 67.11 | |
| 20-EntropyBase Model=Qwen3-14B, Evaluation Setting=JustRL2026.02 | 64.92 | |
| STAPOBase Model=Qwen3-14B, Evaluation Setting=Training-Aligned2026.02 | 64.38 | |
| GRPOBase Model=Qwen3-14B, Evaluation Setting=JustRL2026.02 | 60.81 | |
| 20-EntropyBase Model=Qwen3-14B, Evaluation Setting=Training-Aligned2026.02 | 60.77 | |
| GRPOBase Model=Qwen3-14B, Evaluation Setting=Training-Aligned2026.02 | 60.74 | |
| STAPOBase Model=Qwen3-8B, Evaluation Setting=JustRL2026.02 | 59.92 | |
| STAPOBase Model=Qwen3-8B, Evaluation Setting=Training-Aligned2026.02 | 58.76 | |
| 20-EntropyBase Model=Qwen3-8B, Evaluation Setting=JustRL2026.02 | 57.83 | |
| 20-EntropyBase Model=Qwen3-8B, Evaluation Setting=Training-Aligned2026.02 | 57.63 | |
| GRPOBase Model=Qwen3-8B, Evaluation Setting=Training-Aligned2026.02 | 56.24 | |
| JustRLBase Model=Qwen3-8B, Evaluation Setting=JustRL2026.02 | 56.12 | |
| JustRLBase Model=Qwen3-14B, Evaluation Setting=Training-Aligned2026.02 | 55.74 | |
| GRPOBase Model=Qwen3-8B, Evaluation Setting=JustRL2026.02 | 55.25 | |
| JustRLBase Model=Qwen3-8B, Evaluation Setting=Training-Aligned2026.02 | 50.7 | |
| STAPOBase Model=Qwen3-1.7B, Evaluation Setting=Training-Aligned2026.02 | 38.18 | |
| STAPOBase Model=Qwen3-1.7B, Evaluation Setting=JustRL2026.02 | 36.72 | |
| JustRLBase Model=Qwen3-1.7B, Evaluation Setting=JustRL2026.02 | 34.9 | |
| 20-EntropyBase Model=Qwen3-1.7B, Evaluation Setting=Training-Aligned2026.02 | 33.64 | |
| 20-EntropyBase Model=Qwen3-1.7B, Evaluation Setting=JustRL2026.02 | 33.08 | |
| GRPOBase Model=Qwen3-1.7B, Evaluation Setting=JustRL2026.02 | 31.06 | |
| GRPOBase Model=Qwen3-1.7B, Evaluation Setting=Training-Aligned2026.02 | 30.52 | |
| JustRLBase Model=Qwen3-1.7B, Evaluation Setting=Training-Aligned2026.02 | 29.16 |