Visual Reasoning on R-Bench-V Game
20.7AccuracyMetacognitive Harness
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Metacognitive HarnessBackbone=Sonnet-4.62026.05 | 20.7 | 3.6 | |
| o3Leaderboard Rank=Top-12026.05 | 17.1 | — | |
| Sonnet-4.6Evaluation Mode=Single-pass (Pass@1)2026.05 | 17.1 | — | |
| GPT-5-miniLeaderboard Rank=Top-22026.05 | 16.4 | — | |
| Qwen2.5VL-72BLeaderboard Rank=Top-32026.05 | 14.5 | — |