Mathematical Reasoning on AMC 2023 (Accuracy)
82.2AMC 2023 AccuracyVESPO
Evaluation Results
| Method | Links | |
|---|---|---|
| VESPOModel=Qwen3-8B-Base, gbs/mbs=8, avg@k protocol=avg@162026.02 | 82.2 | |
| GRPOModel=Qwen3-30B-A3B-Base, gbs/mbs=8, avg@k protocol=avg@162026.02 | 81.4 | |
| GSPOModel=Qwen3-8B-Base, gbs/mbs=8, avg@k protocol=avg@162026.02 | 80.8 | |
| GSPOModel=Qwen3-30B-A3B-Base, gbs/mbs=8, avg@k protocol=avg@162026.02 | 80.5 | |
| VESPOModel=Qwen3-30B-A3B-Base, gbs/mbs=8, avg@k protocol=avg@162026.02 | 80.3 | |
| SAPOModel=Qwen3-8B-Base, gbs/mbs=8, avg@k protocol=avg@162026.02 | 80 | |
| GRPOModel=Qwen3-8B-Base, gbs/mbs=8, avg@k protocol=avg@162026.02 | 74.5 | |
| SAPOModel=Qwen3-30B-A3B-Base, gbs/mbs=8, avg@k protocol=avg@162026.02 | 73 | |
| VESPOModel=Llama-3.2-3B-Instruct, gbs/mbs=8, avg@k protocol=avg@162026.02 | 47.3 | |
| GSPOModel=Llama-3.2-3B-Instruct, gbs/mbs=8, avg@k protocol=avg@162026.02 | 43.9 | |
| GRPOModel=Llama-3.2-3B-Instruct, gbs/mbs=8, avg@k protocol=avg@162026.02 | 40.6 | |
| SAPOModel=Llama-3.2-3B-Instruct, gbs/mbs=8, avg@k protocol=avg@162026.02 | 34.1 |