Expert-Level Human Knowledge Reasoning on Humanity's Last Exam
38.3Pass@1Tongyi DeepResearch
Evaluation Results
| Method | Links | |
|---|---|---|
| Tongyi DeepResearchAgent Type=DeepResearch Agent, Mode=Heavy Mode2025.10 | 38.3 | |
| Tongyi DeepResearchAgent Type=DeepResearch Agent, Configuration=30B-A3B2025.10 | 32.9 | |
| DeepSeek-V3.1Agent Type=LLM-based ReAct Agent2025.10 | 29.8 | |
| Gemini DeepResearchAgent Type=DeepResearch Agent2025.10 | 26.9 | |
| Kimi ResearcherAgent Type=DeepResearch Agent2025.10 | 26.9 | |
| OpenAI DeepResearchAgent Type=DeepResearch Agent2025.10 | 26.6 | |
| OpenAI o3Agent Type=LLM-based ReAct Agent2025.10 | 24.9 | |
| GLM 4.5Agent Type=LLM-based ReAct Agent2025.10 | 21.2 | |
| Claude-4-SonnetAgent Type=LLM-based ReAct Agent2025.10 | 20.3 | |
| Kimi K2Agent Type=LLM-based ReAct Agent2025.10 | 18.1 | |
| OpenAI o4-miniAgent Type=LLM-based ReAct Agent2025.10 | 17.7 |