Long-form research report generation on DeepResearchEval (50 queries)
76.8Report QualityMiroThinker-H1
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MiroThinker-H12026.03 | 76.8 | 79.1 | 78 | |
| MiroThinker-1.72026.03 | 76.5 | 78.5 | 77.5 | |
| ChatGPT-5.4 Deep Research2026.03 | 76.4 | 85.5 | 81 | |
| Kimi-K2.5 Deep Research2026.03 | 76 | 64.1 | 70 | |
| MiroThinker-1.7-mini2026.03 | 75.4 | 78.4 | 76.9 | |
| Gemini-3.1-Pro Deep Research2026.03 | 72.3 | 73.3 | 72.8 | |
| Claude-Opus-4.6 Research2026.03 | 69.9 | 66.2 | 68 | |
| GLM-5 Agent2026.03 | 66 | 72.7 | 69.4 | |
| Doubao Deep Research2026.03 | 65.8 | 65.8 | 65.8 | |
| Qwen-3.5-Plus Deep Research2026.03 | 62.4 | 73.6 | 68 | |
| MiniMax-M2.5 Research2026.03 | 62.2 | 76.4 | 69.3 | |
| Grok Deep Research2026.03 | 57.4 | 58 | 57.7 | |
| Manus-1.6-Max Wide Research2026.03 | 53.6 | 76.4 | 65 |