Report Generation on DeepResearch Bench 2025 (test)
49.5ComprehensivenessGemini DeepResearch
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Gemini DeepResearchWorkflow=N/A, Rubric Strategy=N/A2026.02 | 49.5 | 49.5 | 50.1 | 50 | 49.7 | |
| Tongyi-DeepResearchWorkflow=MaMs, Rubric Strategy=Rubric Generator Trained by RL2026.02 | 48.3 | 48.1 | 50.7 | 50.8 | 49.3 | |
| OpenAI DeepResearchWorkflow=N/A, Rubric Strategy=N/A2026.02 | 46.5 | 43.7 | 49.4 | 47.2 | 46.5 | |
| Claude ResearchWorkflow=N/A, Rubric Strategy=N/A2026.02 | 45.3 | 42.8 | 47.6 | 44.7 | 45 | |
| WebWeaver-Qwen3-30B-A3BWorkflow=WebWeaver, Rubric Strategy=N/A2026.02 | 45.2 | 45.8 | 49.2 | 47.3 | 46.8 | |
| Tongyi-DeepResearchWorkflow=ReAct, Rubric Strategy=Rubric Generator Trained by RL2026.02 | 43.4 | 42.5 | 48.8 | 48 | 45.2 | |
| DRTulu-Qwen3-8B-RLWorkflow=ReAct, Rubric Strategy=Self-Evolving Rubrics2026.02 | 41.7 | 41.8 | 48.2 | 41.3 | 43.4 | |
| Qwen3-30B-A3BWorkflow=MaMs, Rubric Strategy=Rubric Generator Trained by RL2026.02 | 41.5 | 41.8 | 49 | 46.9 | 44.3 | |
| Tongyi-DeepResearchWorkflow=MaMs, Rubric Strategy=GPT-5 Generated Rubrics2026.02 | 41.1 | 39.7 | 48.5 | 46.5 | 43.4 | |
| Tongyi-DeepResearchWorkflow=MaMs, Rubric Strategy=Human-defined General Rubrics2026.02 | 40.5 | 39.8 | 48.2 | 45.4 | 42.9 | |
| Tongyi-DeepResearchWorkflow=MaMs, Rubric Strategy=Rubric Generator Trained by SFT2026.02 | 40.5 | 40.9 | 48.2 | 45.7 | 43.4 | |
| Tongyi-DeepResearchWorkflow=ReAct, Rubric Strategy=N/A2026.02 | 39.5 | 34.4 | 46.2 | 44.3 | 40.5 | |
| WebThinker-Qwen2.5-32B-DPOWorkflow=WebThinker, Rubric Strategy=N/A2026.02 | 39.4 | 35.4 | 46 | 43.5 | 40.6 | |
| Tongyi-DeepResearchWorkflow=MaMs, Rubric Strategy=N/A2026.02 | 38.9 | 38.5 | 47.3 | 44.5 | 41.8 | |
| Qwen3-30B-A3BWorkflow=ReAct, Rubric Strategy=Rubric Generator Trained by RL2026.02 | 38.5 | 37.9 | 46 | 43.4 | 41 | |
| Qwen3-30B-A3BWorkflow=ReAct, Rubric Strategy=N/A2026.02 | 33.8 | 29.9 | 39.1 | 40 | 35 |