Math Reasoning on OlympiadBench (Accuracy)
90.7AccuracyAPRM
Evaluation Results
| Method | Links | |
|---|---|---|
| APRMBackbone=Gemma-3-27B2025.11 | 90.7 | |
| APRMBackbone=GPT-OSS-20B2025.11 | 90.4 | |
| APRMBackbone=GPT-OSS-120B2025.11 | 89.4 | |
| ToTBackbone=GPT-OSS-20B2025.11 | 85.6 | |
| ToTBackbone=Gemma-3-27B2025.11 | 85.2 | |
| ReST-MCTSBackbone=GPT-OSS-20B2025.11 | 84.7 | |
| ToTBackbone=GPT-OSS-120B2025.11 | 84.3 | |
| ReST-MCTSBackbone=GPT-OSS-120B2025.11 | 84.3 | |
| ReST-MCTSBackbone=Gemma-3-27B2025.11 | 84.3 | |
| CoT-SCBackbone=GPT-OSS-120B2025.11 | 83.9 | |
| LLM-JBackbone=GPT-OSS-20B2025.11 | 83.9 | |
| LLM-JBackbone=GPT-OSS-120B2025.11 | 83.1 | |
| LLM-JBackbone=Gemma-3-27B2025.11 | 83.1 | |
| Hard Neg.Backbone=Gemma-3-27B2025.11 | 83 | |
| Hard Neg.Backbone=GPT-OSS-120B2025.11 | 79.2 | |
| ARMBackbone=GPT-OSS-120B2025.11 | 77.6 | |
| CoT-SCBackbone=GPT-OSS-20B2025.11 | 61 | |
| ARMBackbone=Gemma-3-27B2025.11 | 61 | |
| TaH+Model Size=4B*2025.11 | 52.6 | |
| OuroModel Size=4B*2025.11 | 51.4 | |
| TaHModel Size=4B*2025.11 | 50.5 | |
| StandardModel Size=4B*2025.11 | 50.4 | |
| SoftThinkModel Size=4B*2025.11 | 50.2 | |
| CoT-SCBackbone=Gemma-3-27B2025.11 | 48.7 | |
| APRMBackbone=Gemma-3-12B2025.11 | 44 | |
| CGDTeacher Model=S1.1-32B2025.05 | 41.3 | |
| CGDTeacher Model=Claude Sonnet 3.72025.05 | 41.2 | |
| ToTBackbone=Gemma-3-12B2025.11 | 40.7 | |
| CFTTeacher Model=GPT-4o2025.05 | 40.7 | |
| ReST-MCTSBackbone=Gemma-3-12B2025.11 | 40.3 | |
| MoCANBackbone=Qwen2.5-7B-Instruct2025.12 | 39.65 | |
| NSPOBackbone=Qwen2.5-7B-Instruct2025.12 | 39 | |
| DPO-MixBackbone=Qwen2.5-7B-Instruct2025.12 | 38.45 | |
| Qwen2.5-7B-Instruct2025.12 | 37.8 | |
| LLM-JBackbone=Gemma-3-12B2025.11 | 37.7 | |
| TaH+Model Size=1.7B2025.11 | 37.6 | |
| TaHModel Size=1.7B2025.11 | 37.2 | |
| CFTTeacher Model=S1.1-32B2025.05 | 36.6 | |
| BFPOBackbone=Qwen2.5-7B-Instruct2025.12 | 36.35 | |
| DPO-HBackbone=Qwen2.5-7B-Instruct2025.12 | 36 | |
| PeCANBackbone=Qwen2.5-7B-Instruct2025.12 | 35.95 | |
| DPO-SBackbone=Qwen2.5-7B-Instruct2025.12 | 35.63 | |
| CoT-SCBackbone=Gemma-3-12B2025.11 | 35.6 | |
| StandardModel Size=1.7B2025.11 | 33.8 | |
| OuroModel Size=1.7B2025.11 | 31.3 | |
| AlwaysThinkModel Size=1.7B2025.11 | 31 | |
| SoftThinkModel Size=1.7B2025.11 | 30.7 | |
| SafeRLHFBackbone=Qwen2.5-7B-Instruct2025.12 | 22.22 | |
| TaH+Model Size=0.6B2025.11 | 20.6 | |
| Qwen2.5-Math-7B (Base)2025.05 | 19.9 | |
| TaHModel Size=0.6B2025.11 | 19.1 | |
| StandardModel Size=0.6B2025.11 | 15.4 | |
| W-DOORBackbone=Qwen2.5-7B-Instruct2025.12 | 15.15 | |
| OuroModel Size=0.6B2025.11 | 14.2 | |
| SoftThinkModel Size=0.6B2025.11 | 14 | |
| AlwaysThinkModel Size=0.6B2025.11 | 12.6 | |
| LycheeDecodeBase Model=DeepSeek-R1-Distill-Qwen-7B, Cache Correction=True2026.02 | 12.5 | |
| TidalDecodeBase Model=DeepSeek-R1-Distill-Llama-8B, Cache Correction=False2026.02 | 10.9 | |
| LycheeDecodeBase Model=DeepSeek-R1-Distill-Llama-8B, Cache Correction=False2026.02 | 10.9 | |
| LycheeDecodeBase Model=DeepSeek-R1-Distill-Llama-8B, Cache Correction=True2026.02 | 10.9 | |
| LycheeDecodeBase Model=DeepSeek-R1-Distill-Qwen-7B, Cache Correction=False2026.02 | 10.9 | |
| Full AttentionBase Model=DeepSeek-R1-Distill-Llama-8B, Cache Correction=False2026.02 | 10.2 | |
| Full AttentionBase Model=DeepSeek-R1-Distill-Qwen-7B, Cache Correction=False2026.02 | 10.2 | |
| TidalDecodeBase Model=DeepSeek-R1-Distill-Llama-8B, Cache Correction=True2026.02 | 9.4 | |
| TidalDecodeBase Model=DeepSeek-R1-Distill-Qwen-7B, Cache Correction=True2026.02 | 8.6 | |
| TidalDecodeBase Model=DeepSeek-R1-Distill-Qwen-7B, Cache Correction=False2026.02 | 7 | |
| Llama3-8B-Instruct2025.12 | 5.7 | |
| BFPOBackbone=Llama3-8B-Instruct2025.12 | 5.49 | |
| W-DOORBackbone=Llama3-8B-Instruct2025.12 | 5.25 | |
| MoCANBackbone=Llama3-8B-Instruct2025.12 | 5.1 | |
| NSPOBackbone=Llama3-8B-Instruct2025.12 | 5 | |
| PeCANBackbone=Llama3-8B-Instruct2025.12 | 4.5 | |
| DPO-HBackbone=Llama3-8B-Instruct2025.12 | 3.85 | |
| DPO-MixBackbone=Llama3-8B-Instruct2025.12 | 3.8 | |
| DPO-SBackbone=Llama3-8B-Instruct2025.12 | 3.45 | |
| SafeRLHFBackbone=Llama3-8B-Instruct2025.12 | 3.3 |