Agentic Task Performance on Agent Capabilities
90.4Success RateGemini-3 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3 ProModel variant=low2026.03 | 90.4 | |
| Gemini-3 ProModel variant=high2026.03 | 90.1 | |
| gpt-5.2Model variant=high2026.03 | 85.7 | |
| gpt-5-miniPrice Range=cost-effective2026.03 | 85.1 | |
| gpt-5.2Model variant=instant2026.03 | 81.1 | |
| kimi-k2Model variant=thinking2026.03 | 77.3 | |
| gpt-4.12026.03 | 73.3 | |
| sabia-42026.03 | 72.2 | |
| Qwen3Model variant=235b2026.03 | 67.8 | |
| gpt-oss-120bPrice Range=cost-effective2026.03 | 60.9 | |
| gpt-4.1-miniPrice Range=cost-effective2026.03 | 59.4 | |
| sabiazinho-4Price Range=cost-effective2026.03 | 55.2 | |
| sabia-3.12026.03 | 43.1 | |
| deepseekModel variant=v3.22026.03 | 40.5 | |
| gemini-2.5-flash-litePrice Range=cost-effective2026.03 | 18 |