Hybrid Reasoning on MMLU (test)
75.3AccuracyAgent-GWO
Evaluation Results
| Method | Links | |
|---|---|---|
| Agent-GWOBackbone=GPT-4o-mini2026.04 | 75.3 | |
| AoTBackbone=GPT-4o-mini2026.04 | 74.7 | |
| Agent-GWOBackbone=Gemma-3-12b-it2026.04 | 72.7 | |
| AoTBackbone=Gemma-3-12b-it2026.04 | 71.9 | |
| ToTBackbone=GPT-4o-mini2026.04 | 71.6 | |
| GoTBackbone=Gemma-3-12b-it2026.04 | 71.6 | |
| GoTBackbone=GPT-4o-mini2026.04 | 71.3 | |
| AFlowBackbone=Gemma-3-12b-it2026.04 | 70.8 | |
| ToTBackbone=Gemma-3-12b-it2026.04 | 70.6 | |
| CoT-SC/n=5Backbone=Gemma-3-12b-it2026.04 | 70.4 | |
| AFlowBackbone=GPT-4o-mini2026.04 | 69.5 | |
| Self-RefineBackbone=Gemma-3-12b-it2026.04 | 69.1 | |
| CoTBackbone=Gemma-3-12b-it2026.04 | 68.4 | |
| CoT-SC/n=5Backbone=GPT-4o-mini2026.04 | 67.1 | |
| Self-RefineBackbone=GPT-4o-mini2026.04 | 64.8 | |
| CoTBackbone=GPT-4o-mini2026.04 | 63.4 | |
| Agent-GWOBackbone=Qwen2.5-Coder-7B-Instruct2026.04 | 58.3 | |
| ToTBackbone=Qwen2.5-Coder-7B-Instruct2026.04 | 56.9 | |
| GoTBackbone=Qwen2.5-Coder-7B-Instruct2026.04 | 56.8 | |
| AoTBackbone=Qwen2.5-Coder-7B-Instruct2026.04 | 56.8 | |
| AFlowBackbone=Qwen2.5-Coder-7B-Instruct2026.04 | 56.5 | |
| CoT-SC/n=5Backbone=Qwen2.5-Coder-7B-Instruct2026.04 | 56.1 | |
| Self-RefineBackbone=Qwen2.5-Coder-7B-Instruct2026.04 | 55.8 | |
| CoTBackbone=Qwen2.5-Coder-7B-Instruct2026.04 | 55.4 |