Multimodal Video Understanding on SPOT-Bench 1.0 (offline)
55.6ABDGPT-5
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| GPT-5#Frames=642026.04 | 55.6 | 36.1 | 40.7 | 30.9 | 28.4 | 56.3 | 41.3 | |
| Gemini-3-Flash#Frames=642026.04 | 46.6 | 30.1 | 38.9 | 29.1 | 30.2 | 24.7 | 33.3 | |
| Qwen2.5-VL#Frames=64, Model Size=7B2026.04 | 40.8 | 16.7 | 12.5 | 0 | 0 | 0 | 11.7 | |
| VideoLLaMA3#Frames=64, Model Size=7B2026.04 | 40.2 | 12.4 | 14.2 | 0 | 0 | 0 | 11.1 | |
| PerceptionLM#Frames=64, Model Size=8B2026.04 | 35.7 | 14.8 | 14.7 | 0 | 0 | 0 | 10.9 | |
| Qwen3-VL#Frames=64, Model Size=8B2026.04 | 34.9 | 19.3 | 11.8 | 0 | 0 | 0 | 11 | |
| InternVL-3.5#Frames=64, Model Size=8B2026.04 | 34.2 | 20.5 | 15.6 | 0 | 12.6 | 32.4 | 19.2 | |
| GPT-5 (Blind baseline)#Frames=02026.04 | 0.4 | 0.3 | 0 | 0 | 0 | 0 | 0.1 |