Conversation Evaluation on Braceval
70.8AccuracyGemini-3 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3 ProModel variant=low2026.03 | 70.8 | |
| Gemini-3 ProModel variant=high2026.03 | 68.1 | |
| sabiazinho-4Price Range=cost-effective2026.03 | 66 | |
| Qwen3Model variant=235b2026.03 | 65.6 | |
| deepseekModel variant=v3.22026.03 | 60.8 | |
| gpt-5.2Model variant=high2026.03 | 60.2 | |
| gpt-5.2Model variant=instant2026.03 | 59 | |
| kimi-k2Model variant=thinking2026.03 | 56.9 | |
| gpt-5-miniPrice Range=cost-effective2026.03 | 56.3 | |
| gpt-oss-120bPrice Range=cost-effective2026.03 | 55.8 | |
| sabia-42026.03 | 53.8 | |
| gemini-2.5-flash-litePrice Range=cost-effective2026.03 | 50.9 | |
| gpt-4.12026.03 | 50.2 | |
| sabia-3.12026.03 | 44.6 | |
| gpt-4.1-miniPrice Range=cost-effective2026.03 | 32.7 |