Visual Reasoning on R-Bench-V Math
59.1AccuracyMetacognitive Harness
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Metacognitive HarnessBackbone=Sonnet-4.62026.05 | 59.1 | 5.7 | |
| Sonnet-4.6Evaluation Mode=Single-pass (Pass@1)2026.05 | 53.4 | — | |
| GPT-5-miniLeaderboard Rank=Top-12026.05 | 48.3 | — | |
| o3Leaderboard Rank=Top-22026.05 | 48.3 | — | |
| o4-miniLeaderboard Rank=Top-32026.05 | 43.2 | — |