Mathematical Reasoning on GSM8K (Accuracy, #Tokens)
97.17AccuracyMC²
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MC²Backbone=Gemini-2.0-flash, Reasoning Method=MC²2026.04 | 97.17 | 573 | |
| MC²Backbone=GPT-4o-mini, Reasoning Method=MC²2026.04 | 96.92 | 833 | |
| MC²Backbone=Qwen3-8B, Reasoning Method=MC²2026.04 | 96.66 | 726 | |
| CoT-SCBackbone=Gemini-2.0-flash, Reasoning Method=CoT-SC2026.04 | 96.03 | 1,100 | |
| ToTBackbone=Gemini-2.0-flash, Reasoning Method=ToT2026.04 | 95.98 | 558 | |
| Buffer of ThoughtBackbone=Gemini-2.0-flash, Reasoning Method=Buffer of Thought2026.04 | 95.96 | 1,324 | |
| Meta ReasoningBackbone=Gemini-2.0-flash, Reasoning Method=Meta Reasoning2026.04 | 95.83 | 219 | |
| CoTBackbone=Gemini-2.0-flash, Reasoning Method=CoT2026.04 | 95.58 | 218 | |
| MC²Backbone=Llama-3.1-8B-Instruct, Reasoning Method=MC²2026.04 | 95.55 | 1,320 | |
| Meta PromptBackbone=Gemini-2.0-flash, Reasoning Method=Meta Prompt2026.04 | 95.43 | 1,111 | |
| Meta PromptBackbone=Qwen3-8B, Reasoning Method=Meta Prompt2026.04 | 94.62 | 522 | |
| CoT-SCBackbone=GPT-4o-mini, Reasoning Method=CoT-SC2026.04 | 94.44 | 1,805 | |
| ToTBackbone=GPT-4o-mini, Reasoning Method=ToT2026.04 | 94.41 | 1,016 | |
| CoT-SCBackbone=Qwen3-8B, Reasoning Method=CoT-SC2026.04 | 94.41 | 1,537 | |
| ToTBackbone=Qwen3-8B, Reasoning Method=ToT2026.04 | 94.09 | 877 | |
| Meta ReasoningBackbone=Qwen3-8B, Reasoning Method=Meta Reasoning2026.04 | 94.06 | 306 | |
| Meta ReasoningBackbone=GPT-4o-mini, Reasoning Method=Meta Reasoning2026.04 | 93.96 | 361 | |
| Buffer of ThoughtBackbone=GPT-4o-mini, Reasoning Method=Buffer of Thought2026.04 | 93.78 | 1,373 | |
| Buffer of ThoughtBackbone=Qwen3-8B, Reasoning Method=Buffer of Thought2026.04 | 93.68 | 1,316 | |
| CoTBackbone=Qwen3-8B, Reasoning Method=CoT2026.04 | 93.45 | 305 | |
| Meta PromptBackbone=GPT-4o-mini, Reasoning Method=Meta Prompt2026.04 | 93.4 | 1,042 | |
| TTPIBackbone=GPT-4o-mini, Reasoning Method=TTPI2026.04 | 92.5 | 874 | |
| CoTBackbone=GPT-4o-mini, Reasoning Method=CoT2026.04 | 91.38 | 358 | |
| Meta PromptBackbone=Llama-3.1-8B-Instruct, Reasoning Method=Meta Prompt2026.04 | 90.44 | 1,217 | |
| TTPIBackbone=Llama-3.1-8B-Instruct, Reasoning Method=TTPI2026.04 | 90.17 | 1,426 | |
| TTPIBackbone=Qwen3-8B, Reasoning Method=TTPI2026.04 | 89.74 | 300 | |
| ToTBackbone=Llama-3.1-8B-Instruct, Reasoning Method=ToT2026.04 | 87.67 | 1,478 | |
| CoT-SCBackbone=Llama-3.1-8B-Instruct, Reasoning Method=CoT-SC2026.04 | 87.29 | 1,936 | |
| Buffer of ThoughtBackbone=Llama-3.1-8B-Instruct, Reasoning Method=Buffer of Thought2026.04 | 86.68 | 1,745 | |
| Meta ReasoningBackbone=Llama-3.1-8B-Instruct, Reasoning Method=Meta Reasoning2026.04 | 86.55 | 447 | |
| CoTBackbone=Llama-3.1-8B-Instruct, Reasoning Method=CoT2026.04 | 85.39 | 528 |