Mathematical Reasoning on AIME 2025 (val) (Accuracy)
62.7AccuracyDeepConf
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepConfSample size (N)=32, Max length=16,000 tokens, Selection variant=best over each dataset2026.06 | 62.7 | |
| Self-ConsistencySample size (N)=32, Max length=16,000 tokens2026.06 | 60.8 | |
| iS@1Sample size (N)=32, Max length=16,000 tokens, Top-k=12026.06 | 52.5 | |
| Self-CertaintySample size (N)=32, Max length=16,000 tokens, Selection variant=best over each dataset2026.06 | 50 | |
| VCPOLag (k)=2, Steps=220, GPU hours=168.92026.02 | 27.8 | |
| SyncLag (k)=0, Steps=300, GPU hours=420.22026.02 | 26.7 | |
| GRPOAlgorithm=GRPO, Base Model=Qwen3-8B-Base, Sampled generations=16, RL Setup=Zero RL2026.04 | 22.92 | |
| GenACAlgorithm=GenAC, Base Model=Qwen3-8B-Base, Sampled generations=16, RL Setup=Zero RL2026.04 | 21.88 | |
| VC-PPOAlgorithm=VC-PPO, Base Model=Qwen3-8B-Base, Sampled generations=16, RL Setup=Zero RL2026.04 | 21.67 | |
| RLOOAlgorithm=RLOO, Base Model=Qwen3-8B-Base, Sampled generations=16, RL Setup=Zero RL2026.04 | 21.25 | |
| Base2026.02 | 5.3 |