Visual Question Answering on SurgAtlas Aexp (MIS partition)
42.3Perception & ID AccuracySurgAtlas-VLM (SurgAtlas)
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| SurgAtlas-VLM (SurgAtlas)Backbone=Qwen3-VL-8B, Fine-tuning regime=SurgAtlas QA pairs (Aqa) alone2026.06 | 42.3 | 42.5 | 37.3 | 44.4 | 58.8 | 42.5 | |
| SurgAtlas-VLM (+ public)Backbone=Qwen3-VL-8B, Fine-tuning regime=SurgAtlas QA pairs (Aqa) + public dataset supervision (Dit)2026.06 | 41.6 | 42.7 | 39.9 | 46.5 | 58.8 | 42.9 | |
| GPT-5.1Frame sampling=4 frames per QA clip2026.06 | 34.2 | 41.7 | 49.7 | 40.8 | 51 | 40.4 | |
| GPT-5Frame sampling=4 frames per QA clip2026.06 | 34 | 39.9 | 49.2 | 38.7 | 45.1 | 39.2 | |
| Qwen3-VL-32BBackbone=Qwen3-VL-32B2026.06 | 30.1 | 24.2 | 28.5 | 33.8 | 47.1 | 28.6 | |
| Gemini 2.5 ProFrame sampling=4 frames per QA clip2026.06 | 28.7 | 35.9 | 38.7 | 34.8 | 46 | 34.1 | |
| Qwen3-VL-8BBackbone=Qwen3-VL-8B2026.06 | 24.3 | 19.9 | 21.8 | 33.8 | 47.1 | 24 |