Wide-Baseline Correspondence Reasoning on ReasonMatch-Bench Overall 90-sample high-divergence subset
94.7F1 ScoreHuman
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Human2026.06 | 94.7 | — | — | |
| Human2026.06 | 84 | — | — | |
| HumanAnnotator=Human2026.06 | 84 | 87.5 | 81.3 | |
| DCRL2026.06 | 70.6 | — | — | |
| DCRL2026.06 | 52 | — | — | |
| DCRLModel Category=Open-Source Models2026.06 | 52 | 48.3 | 56.8 | |
| GPT-5-mini2026.06 | 49.7 | — | — | |
| Qwen3-VL-235B2026.06 | 45.7 | — | — | |
| Gemini-2.5-Pro2026.06 | 44.1 | — | — | |
| GPT-5-mini2026.06 | 37.2 | — | — | |
| GPT-5-miniModel Category=Closed-Source Models2026.06 | 37.2 | 34.5 | 40.7 | |
| Claude-4.5-Sonnet2026.06 | 30.5 | — | — | |
| Qwen3-VL-235B2026.06 | 29.9 | — | — | |
| Qwen3-VL-235BModel Category=Open-Source Models2026.06 | 29.9 | 27.5 | 33 | |
| Gemini-2.5-Pro2026.06 | 29.5 | — | — | |
| Gemini-2.5-ProModel Category=Closed-Source Models2026.06 | 29.5 | 28.3 | 31.1 | |
| Claude-4.5-Sonnet2026.06 | 24 | — | — | |
| Claude-4.5-SonnetModel Category=Closed-Source Models2026.06 | 24 | 22.1 | 26.7 |