Mathematical Reasoning on AMC 2023 (avg@16)
89.8Avg@16 ScoreNSR (Weighted-Reinforce)
Evaluation Results
| Method | Links | |
|---|---|---|
| NSR (Weighted-Reinforce)Backbone=Qwen3-8B, Max response length=40962026.05 | 89.8 | |
| ResRLBackbone=Qwen3-8B, Max response length=40962026.05 | 89.7 | |
| ResRLBase Model=Qwen3-32B, Mode=Think mode, Max response length=81922026.05 | 89.6 | |
| ResRLBackbone=Qwen3-4B, Max response length=40962026.05 | 89.4 | |
| GRPOBackbone=Qwen3-4B, Max response length=40962026.05 | 87.2 | |
| NSR (Weighted-Reinforce)Base Model=Qwen3-32B, Mode=Think mode, Max response length=81922026.05 | 85.8 | |
| FlowRLBackbone=Qwen3-8B, Max response length=40962026.05 | 85.8 | |
| NSR (Weighted-Reinforce)Backbone=Qwen3-4B, Max response length=40962026.05 | 79.8 | |
| GRPOBackbone=Qwen3-8B, Max response length=40962026.05 | 78 | |
| FlowRLBackbone=Qwen3-4B, Max response length=40962026.05 | 74.5 | |
| DAPOBackbone=Qwen3-8B, Max response length=40962026.05 | 71.3 | |
| ResRLBackbone=Qwen3-1.7B, Max response length=40962026.05 | 66.9 | |
| NSR (Weighted-Reinforce)Backbone=Qwen3-1.7B, Max response length=40962026.05 | 66.7 | |
| InstructBackbone=Qwen2.5-Math-7B2026.03 | 65.9 | |
| PowerFlowBackbone=Qwen2.5-Math-7B2026.03 | 63.4 | |
| GRPOBackbone=Qwen2.5-Math-7B2026.03 | 63.4 | |
| DAPOBackbone=Qwen3-4B, Max response length=40962026.05 | 63.4 | |
| Qwen3-8B BackboneBackbone=Qwen3-8B, Max response length=40962026.05 | 61.4 | |
| Qwen2.5-32B-InstructBackbone=Qwen2.5-32B-Instruct2026.03 | 60.3 | |
| EMPOBackbone=Qwen2.5-Math-7B2026.03 | 60.2 | |
| TTRLBackbone=Qwen2.5-Math-7B2026.03 | 58.8 | |
| FlowRLBackbone=Qwen3-1.7B, Max response length=40962026.05 | 58.4 | |
| PowerSamplingBackbone=Qwen2.5-Math-7B2026.03 | 57.5 | |
| DAPOBackbone=Qwen3-1.7B, Max response length=40962026.05 | 57.5 | |
| Qwen3-4B BackboneBackbone=Qwen3-4B, Max response length=40962026.05 | 56.9 | |
| GRPOBackbone=Qwen3-1.7B, Max response length=40962026.05 | 54.2 | |
| PowerFlowBackbone=Qwen2.5-Math-1.5B2026.03 | 53.3 | |
| Low-tempBackbone=Qwen2.5-Math-1.5B2026.03 | 49.5 | |
| GRPOBackbone=Qwen2.5-Math-1.5B2026.03 | 49.5 | |
| InstructBackbone=Qwen2.5-Math-1.5B2026.03 | 49.4 | |
| One-shot EMBackbone=Qwen2.5-Math-7B2026.03 | 48.9 | |
| Low-tempBackbone=Qwen2.5-Math-7B2026.03 | 47.7 | |
| Format-onlyBackbone=Qwen2.5-Math-1.5B2026.03 | 47 | |
| EMPOBackbone=Qwen2.5-Math-1.5B2026.03 | 46.2 | |
| Qwen3-1.7B BackboneBackbone=Qwen3-1.7B, Max response length=40962026.05 | 43.9 | |
| BaseBackbone=Qwen2.5-Math-7B2026.03 | 34.5 | |
| PowerFlowBackbone=Llama-3.2-3B-Instruct2026.03 | 28.8 | |
| BaseBackbone=Qwen2.5-Math-1.5B2026.03 | 28.4 | |
| IntuitorBackbone=Llama-3.2-3B-Instruct2026.03 | 27.3 | |
| GRPOBackbone=Llama-3.2-3B-Instruct2026.03 | 25 | |
| Low-tempBackbone=Llama-3.2-3B-Instruct2026.03 | 24.8 | |
| PowerFlowBackbone=Qwen2.5-1.5B2026.03 | 23.8 | |
| IntuitorBackbone=Qwen2.5-1.5B2026.03 | 22.3 | |
| GRPOBackbone=Qwen2.5-1.5B2026.03 | 21.9 | |
| BaseBackbone=Llama-3.2-3B-Instruct2026.03 | 18.8 | |
| InstructBackbone=Qwen2.5-1.5B2026.03 | 13.6 | |
| Low-tempBackbone=Qwen2.5-1.5B2026.03 | 7.5 | |
| BaseBackbone=Qwen2.5-1.5B2026.03 | 1.4 |