Grounded VQA on SurgVidLM Out-of-domain (test)
35.28mIoUGemini 3-Pro-Preview
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini 3-Pro-PreviewModel Class=Proprietary LMM2026.02 | 35.28 | 21.99 | |
| MedScope-7B-RLModel Class=Reasoning Agent, Training=RL2026.02 | 34.1 | 37.9 | |
| MedScope-7B-SFTModel Class=Reasoning Agent, Training=SFT2026.02 | 32.13 | 35.2 | |
| Video-R1-7BModel Class=Reasoning LMM2026.02 | 31.61 | 21.05 | |
| VideoChat-R1-7BModel Class=Reasoning LMM2026.02 | 29.29 | 15.97 | |
| Video-RFTModel Class=Reasoning LMM2026.02 | 29.21 | 19.3 | |
| LongVT-7B-RFTModel Class=Reasoning Agent2026.02 | 25.72 | 17.02 | |
| ReWatch-R1-7BModel Class=Reasoning Agent2026.02 | 25.47 | 21.99 | |
| InternVL3-8BModel Class=Open-Source LMM2026.02 | 16.6 | 3.53 | |
| GPT-4oModel Class=Proprietary LMM2026.02 | 15.9 | 6.85 | |
| Gemini-2.5-FlashModel Class=Proprietary LMM2026.02 | 12.94 | 4.36 | |
| Qwen2.5-VL-InstructModel Class=Open-Source LMM2026.02 | 11.98 | 3.73 | |
| VideoLLaMA3-7BModel Class=Open-Source LMM2026.02 | 8.55 | 1.93 |