Open Deep Research Evaluation on DeepResearchEval
6.5Cove ScoreSCORE
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SCOREAgent=gpt-researcher (Plan-and-Execute Paradigm), Base Model=Qwen2.5-7B-Inst.2026.06 | 6.5 | 6 | 7.5 | 7 | 5.1 | |
| SCOREAgent=open-deep-research (ReAct Paradigm), Base Model=Qwen2.5-7B-Inst.2026.06 | 6.3 | 5.9 | 7 | 6.6 | 5 | |
| DPOAgent=gpt-researcher (Plan-and-Execute Paradigm), Base Model=Qwen2.5-7B-Inst.2026.06 | 6.1 | 5.8 | 6.8 | 6.5 | 4.8 | |
| SCOREAgent=gpt-researcher (Plan-and-Execute Paradigm), Base Model=Llama-3.1-8B-Inst.2026.06 | 5.9 | 5.6 | 6.9 | 6.9 | 4.6 | |
| DPOAgent=open-deep-research (ReAct Paradigm), Base Model=Qwen2.5-7B-Inst.2026.06 | 4.6 | 4.1 | 5.6 | 5.8 | 3.4 | |
| GRPOAgent=gpt-researcher (Plan-and-Execute Paradigm), Base Model=Qwen2.5-7B-Inst.2026.06 | 4.6 | 4.1 | 5.6 | 5.8 | 3.4 | |
| Qwen2.5-7B-Inst.Agent=gpt-researcher (Plan-and-Execute Paradigm), Base Model=Qwen2.5-7B-Inst.2026.06 | 4.5 | 4.1 | 5.7 | 5.9 | 3.4 | |
| Qwen2.5-7B-Inst.Agent=open-deep-research (ReAct Paradigm), Base Model=Qwen2.5-7B-Inst.2026.06 | 4.4 | 3.9 | 5.2 | 5.4 | 3.2 | |
| GRPOAgent=open-deep-research (ReAct Paradigm), Base Model=Qwen2.5-7B-Inst.2026.06 | 4.4 | 4 | 5.2 | 5.4 | 3.3 | |
| DPOAgent=open-deep-research (ReAct Paradigm), Base Model=Llama-3.1-8B-Inst.2026.06 | 4.3 | 4.3 | 4.7 | 5.2 | 3.5 | |
| SCOREAgent=open-deep-research (ReAct Paradigm), Base Model=Llama-3.1-8B-Inst.2026.06 | 4.3 | 4.4 | 4.7 | 5.2 | 3.5 | |
| Llama-3.1-8B-Inst.Agent=gpt-researcher (Plan-and-Execute Paradigm), Base Model=Llama-3.1-8B-Inst.2026.06 | 3.9 | 3.5 | 4.8 | 5.6 | 2.8 | |
| Llama-3.1-8B-Inst.Agent=open-deep-research (ReAct Paradigm), Base Model=Llama-3.1-8B-Inst.2026.06 | 3.7 | 3.2 | 4.5 | 5.1 | 2.6 | |
| GRPOAgent=gpt-researcher (Plan-and-Execute Paradigm), Base Model=Llama-3.1-8B-Inst.2026.06 | 2.5 | 2.8 | 2.7 | 3.7 | 2 | |
| DPOAgent=gpt-researcher (Plan-and-Execute Paradigm), Base Model=Llama-3.1-8B-Inst.2026.06 | 2.4 | 2.8 | 2.6 | 3.5 | 2 | |
| GRPOAgent=open-deep-research (ReAct Paradigm), Base Model=Llama-3.1-8B-Inst.2026.06 | 1.2 | 1.3 | 1.4 | 1.8 | 1 |