Wide Baseline Matching on ReasonMatch-Bench Indoor (test)
25.5L1 ErrorQwen3-VL-8B-Instruct
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-VL-8B-InstructParameters=8B, Mode=Instruct2026.06 | 25.5 | 38.8 | 17.6 | |
| Claude-4.1-Opus2026.06 | 31 | 36 | 23.8 | |
| GPT-4o-2411062026.06 | 31.9 | 43.7 | 21.7 | |
| Claude-4-Sonnet2026.06 | 33 | 43.7 | 21.3 | |
| Claude-4.5-Sonnet2026.06 | 40.9 | 50.2 | 29.9 | |
| Gemini-2.5-Pro2026.06 | 48.3 | 49.3 | 36.7 | |
| Qwen3-VL-235BParameters=235B2026.06 | 52 | 60.5 | 35.8 | |
| GPT-5-Chat2026.06 | 52.4 | 62.5 | 39.3 | |
| GPT-5-mini2026.06 | 68.2 | 65.3 | 47 | |
| Qwen3-VL-8B + DCRLBackbone=Qwen3-VL-8B, Method=DCRL2026.06 | 84.6 | 75.1 | 67 |