VLM Judge Evaluation on VIABLE averaged over three corpora
52.6Single-Injection AccuracyGPT-5.4
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GPT-5.42026.05 | 52.6 | 20.6 | 78.9 | 65.4 | 10.8 | 2.9 | 68 | 2.9 | 1 | 94.2 | 65.9 | 73 | 9.4 | |
| Claude-Sonnet-4.62026.05 | 45.9 | 15 | 68.7 | 50.2 | 7.2 | 18.1 | 78.8 | 4.1 | 11.5 | 73.3 | 90.3 | 67.9 | 8.1 | |
| Qwen3-VL-8B2026.05 | 24.6 | 3.7 | 46.9 | 27.5 | 2.3 | 50.5 | 13 | 30.2 | 0.8 | 87.8 | 87.6 | 18.8 | 47.2 | |
| InternVL3.5-8B2026.05 | 24 | 3.4 | 45.7 | 34.9 | 14.9 | 20.6 | 10.3 | 66.7 | 15 | 67.1 | 41.3 | 17.3 | 53.2 | |
| MiniCPM-V4.5-8B2026.05 | 23.1 | 2.8 | 42.5 | 34.8 | 17.4 | 13.2 | 3.5 | 80.3 | 13.4 | 70.7 | 27.8 | 16.9 | 59.9 | |
| Youtu-VL-4B2026.05 | 21.6 | 2.4 | 40.9 | 32 | 21.3 | 19.3 | 14.4 | 52.5 | 8.3 | 68.9 | 54.9 | 9.5 | 60.4 | |
| Kimi-VL-A3B2026.05 | 14.9 | 1.2 | 28 | 22.7 | 11.1 | 51.6 | 32.5 | 19.2 | 39 | 14.8 | 84.7 | 22.2 | 33.5 |