Visual Reasoning on R-Bench-V Counting
29.2AccuracyMetacognitive Harness
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Metacognitive HarnessBackbone=Sonnet-4.62026.05 | 29.2 | 4.6 | |
| Sonnet-4.6Evaluation Mode=Single-pass (Pass@1)2026.05 | 24.6 | — | |
| GPT-5-miniLeaderboard Rank=Top-12026.05 | 22.6 | — | |
| o3Leaderboard Rank=Top-22026.05 | 22.1 | — | |
| Gemini-2.5-ProLeaderboard Rank=Top-32026.05 | 19 | — |