Mathematical Reasoning on OlyBench
44.7AccuracyES + TT-MV
Evaluation Results
| Method | Links | |
|---|---|---|
| ES + TT-MVModel=OLMo3-7B-Inst2026.03 | 44.7 | |
| GPT-4o + QuaSARBackbone=GPT-4o, Prompting Strategy=QuaSAR2025.02 | 44.6 | |
| ES + TT-MVModel=OLMo3-7B2026.03 | 43.3 | |
| GPT-4o + CoTBackbone=GPT-4o, Prompting Strategy=CoT2025.02 | 41.8 | |
| GPT-4o + CoMATBackbone=GPT-4o, Prompting Strategy=CoMAT2025.02 | 40.4 | |
| ES + TT-MVModel=Qwen2.5-3B-Inst2026.03 | 39.7 | |
| RandOptModel=Qwen2.5-3B-Inst2026.03 | 39.2 | |
| Llama-3-70B + QuaSARBackbone=Llama-3-70B, Prompting Strategy=QuaSAR2025.02 | 38.2 | |
| ESModel=Qwen2.5-3B-Inst2026.03 | 36.4 | |
| Qwen2-72B + QuaSARBackbone=Qwen2-72B, Prompting Strategy=QuaSAR2025.02 | 36.2 | |
| RandOptModel=OLMo3-7B-Inst2026.03 | 35.4 | |
| PPOModel=Qwen2.5-3B-Inst2026.03 | 34.4 | |
| ESModel=OLMo3-7B-Inst2026.03 | 33.1 | |
| Qwen2-72B + CoMATBackbone=Qwen2-72B, Prompting Strategy=CoMAT2025.02 | 32.2 | |
| RandOptModel=Llama3.1-8B-Inst2026.03 | 32.1 | |
| ES + TT-MVModel=Llama3.1-8B-Inst2026.03 | 32.1 | |
| Best-of-N‡Model=OLMo3-7B-Inst2026.03 | 30.5 | |
| RandOptModel=Qwen2.5-1.5B-Inst2026.03 | 30.4 | |
| Qwen2-72B + CoTBackbone=Qwen2-72B, Prompting Strategy=CoT2025.02 | 30.3 | |
| ESModel=OLMo3-7B2026.03 | 30.2 | |
| GRPOModel=Qwen2.5-3B-Inst2026.03 | 29 | |
| ES + TT-MVModel=Qwen2.5-1.5B-Inst2026.03 | 28.9 | |
| RandOptModel=OLMo3-7B2026.03 | 28.9 | |
| BaseModel=OLMo3-7B-Inst2026.03 | 28.7 | |
| Best-of-N‡Model=Qwen2.5-3B-Inst2026.03 | 28 | |
| PPOModel=OLMo3-7B-Inst2026.03 | 28 | |
| GRPOModel=OLMo3-7B-Inst2026.03 | 27.9 | |
| ESModel=Qwen2.5-1.5B-Inst2026.03 | 27.2 | |
| TT-MV†Model=OLMo3-7B-Inst2026.03 | 26.5 | |
| PPOModel=Qwen2.5-1.5B-Inst2026.03 | 26.3 | |
| BaseModel=Qwen2.5-3B-Inst2026.03 | 24.5 | |
| TT-MV†Model=Llama3.1-8B-Inst2026.03 | 24.5 | |
| GRPOModel=Llama3.1-8B-Inst2026.03 | 23.7 | |
| Best-of-N‡Model=Llama3.1-8B-Inst2026.03 | 23 | |
| PPOModel=OLMo3-7B2026.03 | 22.9 | |
| Llama-3-70B + CoTBackbone=Llama-3-70B, Prompting Strategy=CoT2025.02 | 22.8 | |
| ESModel=Llama3.1-8B-Inst2026.03 | 22.3 | |
| TT-MV†Model=Qwen2.5-3B-Inst2026.03 | 21.8 | |
| Best-of-N‡Model=OLMo3-7B2026.03 | 20.5 | |
| Best-of-N‡Model=Qwen2.5-1.5B-Inst2026.03 | 20 | |
| BaseModel=Llama3.1-8B-Inst2026.03 | 19.2 | |
| GRPOModel=Qwen2.5-1.5B-Inst2026.03 | 18.8 | |
| ESModel=Qwen2.5-0.5B-Inst2026.03 | 16.4 | |
| PPOModel=Qwen2.5-0.5B-Inst2026.03 | 16.1 | |
| PPOModel=Llama3.1-8B-Inst2026.03 | 16.1 | |
| TT-MV†Model=Qwen2.5-1.5B-Inst2026.03 | 15.9 | |
| RandOptModel=Qwen2.5-0.5B-Inst2026.03 | 15.8 | |
| TT-MV†Model=OLMo3-7B2026.03 | 15.7 | |
| Qwen2-72BBackbone=Qwen2-72B, Prompting Strategy=Zero-shot2025.02 | 15.6 | |
| Llama-3-70BBackbone=Llama-3-70B, Prompting Strategy=Zero-shot2025.02 | 14.6 | |
| BaseModel=OLMo3-7B2026.03 | 13.9 | |
| ES + TT-MVModel=Qwen2.5-0.5B-Inst2026.03 | 13.5 | |
| BaseModel=Qwen2.5-1.5B-Inst2026.03 | 13.4 | |
| Best-of-N‡Model=Qwen2.5-0.5B-Inst2026.03 | 10.5 | |
| GPT-4oBackbone=GPT-4o, Prompting Strategy=Zero-shot2025.02 | 9.9 | |
| GRPOModel=Qwen2.5-0.5B-Inst2026.03 | 6.9 | |
| GRPOModel=OLMo3-7B2026.03 | 6.9 | |
| TT-MV†Model=Qwen2.5-0.5B-Inst2026.03 | 6.7 | |
| BaseModel=Qwen2.5-0.5B-Inst2026.03 | 4.2 |