Art Visual Reasoning on Art-Reasoning I
98.65AccuracyBenchmark Agent
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Benchmark Agentevaluation_type=Human & LLM-as-Judge Quality Eval, backbone=GPT-5.12026.06 | 98.65 | 74.06 | 99.7 | 91.98 | 65.49 | 66.04 | 51.12 | 72.19 | — | — | — | — | |
| Qwen3.5evaluation_type=Consistency Evaluation2026.06 | — | — | — | — | — | — | — | — | 40.96 | 46.28 | 51.6 | 56.38 |