Accuracy and Avg on Reasoning on HLE
50.2AccuracyKimi-K2.5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Kimi-K2.5Architecture=Single-Agent ReAct, Backbone=-2026.05 | 50.2 | — | |
| AgentFugueArchitecture=Multi-Agent, Backbone=DeepSeek-v4-Flash, Team size=22026.05 | 49.5 | 65 | |
| Swarm-Multi-AgentArchitecture=Multi-Agent, Backbone=DeepSeek-v4-Flash, Team size=22026.05 | 44 | 57.6 | |
| Naive-Multi-AgentArchitecture=Multi-Agent, Backbone=DeepSeek-v4-Flash, Team size=22026.05 | 43.5 | 57.3 | |
| Claude-Opus-4.5Architecture=Single-Agent ReAct, Backbone=-2026.05 | 43.4 | — | |
| DeepSeek-v4-FlashArchitecture=Single-Agent ReAct, Backbone=-2026.05 | 42 | 56 | |
| AgentFugueArchitecture=Multi-Agent, Backbone=Qwen3.5-35B-A3B, Team size=22026.05 | 41 | 54.4 | |
| GLM-4.7Architecture=Single-Agent ReAct, Backbone=-2026.05 | 37.2 | 48.7 | |
| Qwen3.5-35B-A3BArchitecture=Single-Agent ReAct, Backbone=-2026.05 | 34 | 45.2 | |
| Tongyi-DeepResearchArchitecture=Single-Agent DeepResearch, Backbone=Qwen3-30B-A3B2026.05 | 32.9 | — | |
| Naive-Multi-AgentArchitecture=Multi-Agent, Backbone=Qwen3.5-35B-A3B, Team size=22026.05 | 32.2 | 48.5 | |
| Swarm-Multi-AgentArchitecture=Multi-Agent, Backbone=Qwen3.5-35B-A3B, Team size=22026.05 | 31.5 | 49 | |
| IterResearchArchitecture=Single-Agent DeepResearch, Backbone=Qwen3-30B-A3B2026.05 | 28.8 | — | |
| OpenAI DeepResearchArchitecture=Single-Agent DeepResearch, Backbone=-2026.05 | 26.6 | — | |
| WebThinkerArchitecture=Single-Agent DeepResearch, Backbone=QwQ-32B2026.05 | 15.8 | — | |
| WebSailorArchitecture=Single-Agent DeepResearch, Backbone=QwQ-32B2026.05 | 9.6 | — |