Reasoning on SAT
97.6Accuracy (SAT)CoFiCot
Evaluation Results
| Method | Links | |
|---|---|---|
| CoFiCotBackbone=Qwen2.5-Math-7B2026.03 | 97.6 | |
| k-way SCBackbone=Qwen2.5-Math-7B, k=402026.03 | 97.3 | |
| k-way SCBackbone=Qwen2.5-Math-7B, k=1202026.03 | 97.3 | |
| Best-of-kBackbone=Qwen2.5-Math-7B, k=1202026.03 | 95.2 | |
| Qwen2.5-Math-7BBackbone=Qwen2.5-Math-7B2026.03 | 92.3 | |
| CoFiCotBase Model=GPT-3.5-Turbo2026.03 | 90.1 | |
| Best-of-kBase Model=GPT-3.5-Turbo, k=1202026.03 | 87.8 | |
| k-way SCBase Model=GPT-3.5-Turbo, k=1202026.03 | 87.6 | |
| Self-Refine + k-way SCBase Model=GPT-3.5-Turbo, k=1202026.03 | 85.6 | |
| Self-RefineBase Model=GPT-3.5-Turbo2026.03 | 77.3 | |
| Zero-shot CoTBase Model=GPT-3.5-Turbo2026.03 | 76.8 | |
| CoFiCotBase Model=Llama3-8B-Instruct2026.03 | 75 | |
| Best-of-kBase Model=Llama3-8B-Instruct, k=1202026.03 | 72.4 | |
| k-way SCBase Model=Llama3-8B-Instruct, k=1202026.03 | 70.5 | |
| Self-Refine + k-way SCBase Model=Llama3-8B-Instruct, k=1202026.03 | 68.2 | |
| Zero-shot CoTBase Model=Llama3-8B-Instruct2026.03 | 58.2 | |
| Self-RefineBase Model=Llama3-8B-Instruct2026.03 | 57.7 |