Wide Baseline Matching on ReasonMatch-Bench Overall (test)
70.5F1 ScoreQwen3-VL-8B + DCRL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-VL-8B + DCRLBackbone=Qwen3-VL-8B, Method=DCRL2026.06 | 70.5 | 70.3 | 71.1 | |
| GPT-5-mini2026.06 | 57.9 | 56.9 | 59.4 | |
| GPT-5-Chat2026.06 | 51.5 | 50.6 | 52.8 | |
| Qwen3-VL-235BParameters=235B2026.06 | 49.2 | 50.7 | 48.7 | |
| Gemini-2.5-Pro2026.06 | 42.8 | 42.4 | 43.4 | |
| Claude-4.5-Sonnet2026.06 | 41.7 | 43.7 | 41.1 | |
| Claude-4-Sonnet2026.06 | 34.8 | 34.2 | 35.5 | |
| Claude-4.1-Opus2026.06 | 33.7 | 37.2 | 32.2 | |
| GPT-4o-2411062026.06 | 33.5 | 32.7 | 34.7 | |
| Qwen3-VL-8B-InstructParameters=8B, Mode=Instruct2026.06 | 27.5 | 27.1 | 29.1 |