Multi-step Mathematical Reasoning on MMLU (test)
90.84AccuracyLLM-Debate
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLM-DebateBackbone=DeepSeek-V3.22026.05 | 90.84 | 404.09 | |
| Random GraphBackbone=DeepSeek-V3.22026.05 | 90.4 | 255.06 | |
| Self-ConsistencyBackbone=DeepSeek-V3.22026.05 | 90.36 | 12.47 | |
| TCP-MCPBackbone=DeepSeek-V3.22026.05 | 89.96 | 88.03 | |
| PHPBackbone=DeepSeek-V3.22026.05 | 87.96 | 9.13 | |
| G-DesignerBackbone=DeepSeek-V3.22026.05 | 87.9 | 28.04 | |
| Complex CoTBackbone=DeepSeek-V3.22026.05 | 87.49 | 4.87 | |
| LLM-BlenderBackbone=DeepSeek-V3.22026.05 | 87.23 | 4.68 | |
| MetaGPTBackbone=DeepSeek-V3.22026.05 | 86.2 | 1.86 | |
| Complete GraphBackbone=DeepSeek-V3.22026.05 | 85.92 | 82.71 | |
| Zero-shotBackbone=DeepSeek-V3.22026.05 | 84.1 | 3.42 | |
| ChatDevBackbone=DeepSeek-V3.22026.05 | 83.71 | 4.14 | |
| GPTSwarmBackbone=DeepSeek-V3.22026.05 | 81.7 | 12.6 | |
| AutoGenBackbone=DeepSeek-V3.22026.05 | 80.37 | 2.27 |