Multi-task Language Understanding on MMLU-Pro (Performance and Token Count)
92.86PerformanceAgent Q-Mix
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Agent Q-MixBackbone=GPT-OSS:120B2026.04 | 92.86 | 112 | |
| LongGraphBackbone=GPT-OSS:120B2026.04 | 92.86 | 1.25 | |
| TopoDIMBackbone=GPT-OSS:120B2026.04 | 88.57 | 1.14 | |
| LobsterBackbone=GPT-OSS:120B2026.04 | 87.14 | 97 | |
| AutoGenBackbone=GPT-OSS:120B2026.04 | 87.14 | 1 | |
| GTDBackbone=GPT-OSS:120B2026.04 | 85.71 | 1.02 | |
| G-DesignerBackbone=GPT-OSS:120B2026.04 | 84.29 | 1.05 | |
| GPTSwarmBackbone=GPT-OSS:120B2026.04 | 81.43 | 2.17 | |
| AgentFmwBackbone=GPT-OSS:120B2026.04 | 80 | 471 | |
| LLM-DebateBackbone=GPT-OSS:120B2026.04 | 79 | 2.71 |