Mathematical Reasoning on MATH (EM)
84.5EMGHS-TDA
Evaluation Results
| Method | Links | |
|---|---|---|
| GHS-TDABackbone=DeepSeek-V32026.02 | 84.5 | |
| AoTBackbone=DeepSeek-V3, Reasoning Paradigm=atomic reasoning2026.02 | 84 | |
| GHS-TDABackbone=GPT-4o-mini2026.02 | 83.9 | |
| GHS-TDABackbone=Qwen-Turbo2026.02 | 83.7 | |
| AoTBackbone=GPT-4o-mini, Reasoning Paradigm=atomic reasoning2026.02 | 83.6 | |
| AoTBackbone=Qwen-Turbo, Reasoning Paradigm=atomic reasoning2026.02 | 83.5 | |
| AFlowBackbone=DeepSeek-V3, Reasoning Paradigm=search-based2026.02 | 83.4 | |
| GoTBackbone=DeepSeek-V3, Reasoning Paradigm=graph-based2026.02 | 83.2 | |
| AFlowBackbone=GPT-4o-mini, Reasoning Paradigm=search-based2026.02 | 83 | |
| GoTBackbone=GPT-4o-mini, Reasoning Paradigm=graph-based2026.02 | 83 | |
| GoTBackbone=Qwen-Turbo, Reasoning Paradigm=graph-based2026.02 | 82.7 | |
| FoTBackbone=DeepSeek-V3, Reasoning Paradigm=forest-based, n=82026.02 | 82.7 | |
| FoTBackbone=GPT-4o-mini, Reasoning Paradigm=forest-based, n=82026.02 | 82.5 | |
| AFlowBackbone=Qwen-Turbo, Reasoning Paradigm=search-based2026.02 | 82.4 | |
| FoTBackbone=Qwen-Turbo, Reasoning Paradigm=forest-based, n=82026.02 | 82.2 | |
| CoT-SCBackbone=DeepSeek-V3, Reasoning Paradigm=chain-based, n=52026.02 | 82 | |
| CoT-SCBackbone=GPT-4o-mini, Reasoning Paradigm=chain-based, n=52026.02 | 81.8 | |
| CoT-SCBackbone=Qwen-Turbo, Reasoning Paradigm=chain-based, n=52026.02 | 81.4 | |
| ToTBackbone=GPT-4o-mini, Reasoning Paradigm=tree-based2026.02 | 79.2 | |
| ToTBackbone=DeepSeek-V3, Reasoning Paradigm=tree-based2026.02 | 79.1 | |
| ToTBackbone=Qwen-Turbo, Reasoning Paradigm=tree-based2026.02 | 78.9 | |
| Self-RefineBackbone=DeepSeek-V3, Reasoning Paradigm=chain-based2026.02 | 78.9 | |
| Self-RefineBackbone=GPT-4o-mini, Reasoning Paradigm=chain-based2026.02 | 78.7 | |
| Self-RefineBackbone=Qwen-Turbo, Reasoning Paradigm=chain-based2026.02 | 78.5 | |
| CoTBackbone=DeepSeek-V3, Reasoning Paradigm=chain-based2026.02 | 78.5 | |
| CoTBackbone=GPT-4o-mini, Reasoning Paradigm=chain-based2026.02 | 78.3 | |
| CoTBackbone=Qwen-Turbo, Reasoning Paradigm=chain-based2026.02 | 78.1 | |
| Analogical PromptingBackbone=DeepSeek-V3, Reasoning Paradigm=chain-based2026.02 | 65.6 | |
| Analogical PromptingBackbone=GPT-4o-mini, Reasoning Paradigm=chain-based2026.02 | 65.4 | |
| Analogical PromptingBackbone=Qwen-Turbo, Reasoning Paradigm=chain-based2026.02 | 65.2 | |
| DeepSeekMoE 16B# Shot=4-shot, # Total Params=16.4B, # Activated Params=2.8B, FLOPs per 4K Tokens=74.4T, # Training Tokens=2T2024.01 | 4.3 | |
| DeepSeekMoE 16B# Shot=4-shot, # Total Params=16.4B, # Activated Params=2.8B, FLOPs per 4K Tokens=74.4T, # Training Tokens=2T2024.01 | 4.3 | |
| DeepSeek 7B (Dense)# Shot=4-shot, # Total Params=6.9B, # Activated Params=6.9B, FLOPs per 4K Tokens=183.5T, # Training Tokens=2T2024.01 | 3.3 | |
| DeepSeekMoE 145B# Shot=4-shot2024.01 | 3.1 | |
| DeepSeekMoE 142B (Half Activated)# Shot=4-shot2024.01 | 2.8 | |
| LLaMA2 7B# Shot=4-shot, # Total Params=6.7B, # Activated Params=6.7B, FLOPs per 4K Tokens=187.9T, # Training Tokens=2T2024.01 | 2.6 | |
| DeepSeek 67B (Dense)# Shot=4-shot2024.01 | 2.1 | |
| GShard 137B# Shot=4-shot2024.01 | 1.6 |