Research Task on DeepResearchBench (DRB)
95.9Accuracy (%)GPT 5.4
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT 5.4Deployment=Cloud baseline2026.05 | 95.9 | — | |
| LLM-guided spec searchStudent Model=Qwen3.5-9B, Optimization Status=Optimized, Teacher Selection=Best teacher per benchmark2026.05 | 92.5 | 16.7 | |
| Claude Opus 4.6Deployment=Cloud baseline2026.05 | 90.1 | — | |
| Gemini 3.1 ProDeployment=Cloud baseline2026.05 | 85.2 | — | |
| Qwen3.5-122BDeployment=Local model2026.05 | 80.5 | — | |
| Best LocalConfig=Oracle local routing frontier2026.05 | 80.5 | — | |
| Qwen3.5-35BDeployment=Local model2026.05 | 79.4 | — | |
| Qwen3.5-27BDeployment=Local model2026.05 | 77.6 | — | |
| Qwen3.5-9BStudent Model=Qwen3.5-9B, Optimization Status=Base2026.05 | 75.8 | — | |
| Qwen3.5-9BDeployment=Local model2026.05 | 75.8 | — | |
| Gemma4-26BDeployment=Local model2026.05 | 72.1 | — | |
| LLM-guided spec searchStudent Model=Qwen3.5-4B, Optimization Status=Optimized, Teacher Selection=Best teacher per benchmark2026.05 | 63.1 | 13.1 | |
| Nemotron-Super-120BDeployment=Local model2026.05 | 63 | — | |
| Qwen3.5-4BStudent Model=Qwen3.5-4B, Optimization Status=Base2026.05 | 50 | — | |
| Granite 4.0 H-SmallDeployment=Local model2026.05 | 42 | — | |
| LLM-guided spec searchStudent Model=Gemma4-E4B, Optimization Status=Optimized, Teacher Selection=Best teacher per benchmark2026.05 | 38.2 | 15.6 | |
| Gemma4-E4BStudent Model=Gemma4-E4B, Optimization Status=Base2026.05 | 22.6 | — | |
| Gemma4-E4BDeployment=Local model2026.05 | 22.6 | — | |
| LLM-guided spec searchStudent Model=Nemotron-Nano-4B, Optimization Status=Optimized, Teacher Selection=Best teacher per benchmark2026.05 | 15.6 | 15.6 | |
| Granite 3.3 8BDeployment=Local model2026.05 | 10.5 | — | |
| Nemotron-Nano-4BStudent Model=Nemotron-Nano-4B, Optimization Status=Base2026.05 | 0 | — |