Multi-step Reasoning and Factuality on FRAMES (Pass@1)
90.6Pass@1Tongyi DeepResearch
Evaluation Results
| Method | Links | |
|---|---|---|
| Tongyi DeepResearchAgent Type=DeepResearch Agent, Configuration=30B-A3B2025.10 | 90.6 | |
| OpenAI o3Agent Type=LLM-based ReAct Agent2025.10 | 84 | |
| DeepSeek-V3.1Agent Type=LLM-based ReAct Agent2025.10 | 83.7 | |
| Claude-4-SonnetAgent Type=LLM-based ReAct Agent2025.10 | 80.7 | |
| GLM 4.5Agent Type=LLM-based ReAct Agent2025.10 | 78.9 | |
| Kimi ResearcherAgent Type=DeepResearch Agent2025.10 | 78.8 | |
| Kimi K2Agent Type=LLM-based ReAct Agent2025.10 | 72 |