Visual Question Answering on V*Bench Relabel
75.9AccuracyGPT-5.5
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5.52026.06 | 75.9 | |
| Qwen3.6-Plus2026.06 | 74.3 | |
| Seed-2.0-Lite2026.06 | 74.3 | |
| Gemini 3.1 Pro2026.06 | 69.6 | |
| MiMo v2.52026.06 | 66.5 | |
| Kimi K2.62026.06 | 63.4 | |
| Claude Opus 4.72026.06 | 59.7 | |
| Llama 4 Maverick2026.06 | 51.8 |