Problem-Solving on MMLU (test)
81.97MMLU Problem Solving AccuracyMANGO
Evaluation Results
| Method | Links | |
|---|---|---|
| MANGOBase LLM=GPT-4o-mini2026.05 | 81.97 | |
| MANGO (Skip-2)Base LLM=GPT-4o-mini2026.05 | 80.73 | |
| AFlowBase LLM=GPT-4o-mini2026.05 | 80.52 | |
| Plan-and-ExecuteBase LLM=GPT-4o-mini2026.05 | 80.33 | |
| DyLANBase LLM=GPT-4o-mini2026.05 | 80.32 | |
| MaASBase LLM=GPT-4o-mini2026.05 | 80.3 | |
| GPTSwarmBase LLM=GPT-4o-mini2026.05 | 78.34 | |
| AgentSquareBase LLM=GPT-4o-mini2026.05 | 78.01 | |
| ADASBase LLM=GPT-4o-mini2026.05 | 69.6 | |
| MultiPersonaBase LLM=GPT-4o-mini2026.05 | 65.94 | |
| SC (CoT×5)Base LLM=GPT-4o-mini2026.05 | 65.9 | |
| LLM-DebateBase LLM=GPT-4o-mini2026.05 | 65.64 | |
| CoTBase LLM=GPT-4o-mini2026.05 | 65.43 | |
| Self-RefineBase LLM=GPT-4o-mini2026.05 | 63.5 | |
| IO (direct LLM invocation)Base LLM=GPT-4o-mini2026.05 | 63.44 | |
| VICUNA-7BModel size=7B2023.08 | 47.18 | |
| STARLING (BLUE)Data strategy=BLUE2023.08 | 46.69 | |
| VICUNA-FT-7BModel size=7B, Training=Fine-tuned2023.08 | 46.53 | |
| STARLING (BLUE-RED)Data strategy=BLUE-RED2023.08 | 46.49 |