Multi-step Mathematical Reasoning on MMLU-Pro (held-out test)
83.67AccuracyLLM-Debate
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLM-DebateBackbone=DeepSeek-V3.22026.05 | 83.67 | 553,410,000 | |
| TCP-MCPBackbone=DeepSeek-V3.22026.05 | 82.66 | 97,280,000 | |
| Random GraphBackbone=DeepSeek-V3.22026.05 | 82.59 | 331,480,000 | |
| Complex CoTBackbone=DeepSeek-V3.22026.05 | 79.74 | 11,040,000 | |
| G-DesignerBackbone=DeepSeek-V3.22026.05 | 79.32 | 32,870,000 | |
| Self-ConsistencyBackbone=DeepSeek-V3.22026.05 | 76.12 | 45,690,000 | |
| PHPBackbone=DeepSeek-V3.22026.05 | 74.71 | 14,460,000 | |
| GPTSwarmBackbone=DeepSeek-V3.22026.05 | 74.23 | 20,620,000 | |
| Complete GraphBackbone=DeepSeek-V3.22026.05 | 73.95 | 132,450,000 | |
| LLM-BlenderBackbone=DeepSeek-V3.22026.05 | 63.55 | 6,430,000 | |
| ChatDevBackbone=DeepSeek-V3.22026.05 | 62.19 | 5,470,000 | |
| MetaGPTBackbone=DeepSeek-V3.22026.05 | 59.03 | 2,530,000 | |
| AutoGenBackbone=DeepSeek-V3.22026.05 | 55.72 | 3,180,000 | |
| Zero-shotBackbone=DeepSeek-V3.22026.05 | 54.36 | 2,790,000 |