Mathematical Problem Solving on MATH (Exact Match Accuracy)
82.5Accuracy (Exact Match)ANN
Evaluation Results
| Method | Links | |
|---|---|---|
| ANNBackbone=GPT-4o-mini2025.06 | 82.5 | |
| ANNBackbone=GPT-42025.06 | 80 | |
| Captain AgentBackbone=GPT-42025.06 | 77.55 | |
| AutoGenBackbone=GPT-42025.06 | 74.49 | |
| AgentVerseBackbone=GPT-42025.06 | 69.38 | |
| Meta-promptingBackbone=GPT-42025.06 | 68.88 | |
| DyLANBackbone=GPT-42025.06 | 62.24 | |
| AutoAgentsBackbone=GPT-42025.06 | 56.12 | |
| ANNBackbone=GPT-3.5-turbo2025.06 | 55 | |
| Vanilla LLMBackbone=GPT-42025.06 | 51.53 | |
| HARP-CModel=QWEN3-8B, Train Dataset=Wiz2026.06 | 46.2 | |
| RandModel=QWEN3-8B, Train Dataset=Wiz2026.06 | 45.7 | |
| Full FTModel=QWEN3-8B, Train Dataset=Wiz2026.06 | 43.5 | |
| HARP-EModel=QWEN3-4B, Train Dataset=SI2026.06 | 31.8 | |
| DCDM (MoE)Scale=1.5B, Active Params=1.2B (2.8B), In-context examples=2-shot, Fine-tuning=true2026.05 | 23.2 | |
| DCDMScale=1.5B, Active Params=1.5B, In-context examples=2-shot, Fine-tuning=true2026.05 | 22.6 | |
| BDLMScale=1.5B, Active Params=1.5B, In-context examples=2-shot, Fine-tuning=true2026.05 | 21.4 | |
| MDLMScale=1.5B, Active Params=1.5B, In-context examples=2-shot, Fine-tuning=true2026.05 | 18.8 | |
| DCDM (MoE)Scale=0.5B, Active Params=0.4B (0.8B), In-context examples=2-shot, Fine-tuning=true2026.05 | 11.2 | |
| DCDMScale=0.5B, Active Params=0.5B, In-context examples=2-shot, Fine-tuning=true2026.05 | 10.2 | |
| BDLMScale=0.5B, Active Params=0.5B, In-context examples=2-shot, Fine-tuning=true2026.05 | 9.6 | |
| MDLMScale=0.5B, Active Params=0.5B, In-context examples=2-shot, Fine-tuning=true2026.05 | 7.4 |