Grounded VQA on OphVL In-domain (test)
73.81mIoUGemini 3-Pro-Preview
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini 3-Pro-PreviewModel Class=Proprietary LMM2026.02 | 73.81 | 34.12 | |
| MedScope-7B-RLModel Class=Reasoning Agent, Training=RL2026.02 | 65.58 | 35.1 | |
| MedScope-7B-SFTModel Class=Reasoning Agent, Training=SFT2026.02 | 53.28 | 25.03 | |
| Gemini-2.5-FlashModel Class=Proprietary LMM2026.02 | 43.38 | 12.59 | |
| LongVT-7B-RFTModel Class=Reasoning Agent2026.02 | 42.17 | 14.16 | |
| Video-R1-7BModel Class=Reasoning LMM2026.02 | 41.6 | 27.45 | |
| GPT-4oModel Class=Proprietary LMM2026.02 | 40.08 | 9.79 | |
| InternVL3-8BModel Class=Open-Source LMM2026.02 | 39.48 | 9.79 | |
| ReWatch-R1-7BModel Class=Reasoning Agent2026.02 | 36.2 | 16.78 | |
| Qwen2.5-VL-InstructModel Class=Open-Source LMM, Parameters=7B2026.02 | 32.91 | 4.37 | |
| VideoChat-R1-7BModel Class=Reasoning LMM2026.02 | 32.4 | 14.68 | |
| Video-RFTModel Class=Reasoning LMM2026.02 | 28.7 | 15.24 | |
| VideoLLaMA3-7BModel Class=Open-Source LMM2026.02 | 20.78 | 1.34 |