Research Task on LiveResearchBench (LRB)
96.2AccuracyGPT 5.4
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT 5.4Deployment=Cloud baseline2026.05 | 96.2 | — | |
| Gemini 3.1 ProDeployment=Cloud baseline2026.05 | 92.5 | — | |
| LLM-guided spec searchStudent Model=Qwen3.5-9B, Optimization Status=Optimized, Teacher Selection=Best teacher per benchmark2026.05 | 91 | 13.5 | |
| Qwen3.5-122BDeployment=Local model2026.05 | 90.5 | — | |
| Best LocalConfig=Oracle local routing frontier2026.05 | 90.5 | — | |
| Claude Opus 4.6Deployment=Cloud baseline2026.05 | 90 | — | |
| Qwen3.5-35BDeployment=Local model2026.05 | 86.9 | — | |
| Gemma4-26BDeployment=Local model2026.05 | 84.2 | — | |
| Qwen3.5-27BDeployment=Local model2026.05 | 82.5 | — | |
| Nemotron-Super-120BDeployment=Local model2026.05 | 80.1 | — | |
| LLM-guided spec searchStudent Model=Qwen3.5-4B, Optimization Status=Optimized, Teacher Selection=Best teacher per benchmark2026.05 | 80 | 66.2 | |
| Qwen3.5-9BStudent Model=Qwen3.5-9B, Optimization Status=Base2026.05 | 77.5 | — | |
| Qwen3.5-9BDeployment=Local model2026.05 | 77.5 | — | |
| LLM-guided spec searchStudent Model=Nemotron-Nano-4B, Optimization Status=Optimized, Teacher Selection=Best teacher per benchmark2026.05 | 75 | 62.5 | |
| LLM-guided spec searchStudent Model=Gemma4-E4B, Optimization Status=Optimized, Teacher Selection=Best teacher per benchmark2026.05 | 68.5 | 17.5 | |
| Granite 3.3 8BDeployment=Local model2026.05 | 60.3 | — | |
| Gemma4-E4BStudent Model=Gemma4-E4B, Optimization Status=Base2026.05 | 51 | — | |
| Gemma4-E4BDeployment=Local model2026.05 | 51 | — | |
| Granite 4.0 H-SmallDeployment=Local model2026.05 | 50.6 | — | |
| Qwen3.5-4BStudent Model=Qwen3.5-4B, Optimization Status=Base2026.05 | 13.8 | — | |
| Nemotron-Nano-4BStudent Model=Nemotron-Nano-4B, Optimization Status=Base2026.05 | 12.5 | — |