3D Question Answering on VSI-Bench
64.7Average ScoreGS-Reasoner
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| GS-ReasonerType=Open-source Post-trained Models2026.05 | 64.7 | 69.1 | 61.9 | 70 | 65.7 | 65.4 | 88.9 | 44.3 | 52.3 | |
| Loc3R-VLMModel Category=Ours2026.03 | 63.2 | 68.9 | 47.3 | 64.9 | 61.2 | 62.1 | 82.4 | 44.9 | 73.8 | |
| Qwen3-VL-8BType=Open-source Post-trained Models2026.05 | 62.1 | 69.8 | 52 | 76.4 | 57 | 61.4 | 52.7 | 39.2 | 72.2 | |
| VLM-3RModel Category=Expert Models2026.03 | 60.9 | 70.2 | 49.4 | 69.2 | 67.1 | 65.4 | 80.5 | 45.4 | 40.1 | |
| VLM-3R-7BType=Open-source Post-trained Models2026.05 | 60.9 | 70.2 | 49.4 | 69.2 | 67.1 | 65.4 | 80.5 | 45.4 | 40.1 | |
| TRACEBase Model=Gemini 3 Pro2026.03 | 60.15 | 47.55 | 38.82 | 73.9 | 45.62 | 63.85 | 61.7 | 58.01 | 72.97 | |
| CMBase Model=Gemini 3 Pro2026.03 | 59.72 | 46.7 | 41.43 | 72.49 | 50.14 | 63.69 | 58.62 | 55.5 | 72.61 | |
| LtMBase Model=Gemini 3 Pro2026.03 | 59.52 | 45.19 | 40.72 | 73.36 | 44.15 | 65.82 | 60.4 | 53.59 | 73.64 | |
| ToTBase Model=Gemini 3 Pro2026.03 | 58.88 | 44.55 | 42.12 | 72.2 | 45.55 | 65.35 | 57.83 | 55.62 | 73.73 | |
| CoTBase Model=Gemini 3 Pro2026.03 | 53.65 | 30.35 | 34.54 | 64.05 | 40.76 | 61.78 | 58.09 | 61.34 | 71.96 | |
| DirectBase Model=Gemini 3 Pro2026.03 | 52.61 | 33.77 | 32.57 | 67.09 | 42.99 | 62.54 | 50.52 | 51.03 | 70.71 | |
| Qwen2.5-VL-7B + ViSRABase Model=Qwen2.5-VL-7B, Method=ViSRA2026.05 | 52.2 | 46.4 | 27.8 | 60.1 | 47.7 | 51.3 | 71.7 | 43.8 | 53.7 | |
| InternVL3-8B + ViSRABase Model=InternVL3-8B, Method=ViSRA2026.05 | 50.8 | 36.6 | 34.6 | 58.8 | 52.7 | 47.3 | 62.4 | 46.9 | 59.7 | |
| VG-LLM-8BModel Category=2D MLLMs2026.03 | 50.7 | 67.9 | 37.7 | 58.6 | 62 | 46.6 | 40.7 | 32.4 | 59.2 | |
| Qwen2.5-VL-7BDataset Source=All2026.04 | 50.7 | 67.1 | 38.3 | 65.8 | 53.5 | 51.7 | 57.3 | 41.2 | 29.8 | |
| Qwen2.5-VL-7BDataset Source=SN, SN++2026.04 | 50 | 68.3 | 38.8 | 64.8 | 53 | 52.8 | 47.3 | 37.1 | 37.7 | |
| Qwen2.5-VL-3BDataset Source=All2026.04 | 49.3 | 67.5 | 39.3 | 63.5 | 54 | 50.3 | 55.8 | 36.6 | 27.2 | |
| Gemini-1.5 ProType=Proprietary Models2026.05 | 48.8 | 49.6 | 28.8 | 58.6 | 49.4 | 46 | 48.1 | 42 | 68 | |
| Qwen2.5-VL-3BDataset Source=SN, SN++2026.04 | 48.7 | 67.4 | 39.6 | 64 | 53.8 | 48.9 | 44.9 | 38.7 | 32.4 | |
| SpatialMLLM-4BModel Category=2D MLLMs2026.03 | 48.4 | 65.3 | 34.8 | 63.1 | 45.1 | 41.3 | 46.2 | 33.5 | 46.3 | |
| InternVL3.5-8BType=Open-source Post-trained Models2026.05 | 48.1 | 53.7 | 30.5 | 60.5 | 46.3 | 49.9 | 42.9 | 33 | 59.1 | |
| Spatial-MLLM-4BType=Open-source Post-trained Models2026.05 | 47.9 | 65.3 | 34.6 | 63.8 | 44.2 | 40.7 | 44.3 | 34.5 | 45.5 | |
| Qwen2.5-VL-7BDataset Source=SV++2026.04 | 46.4 | 63.8 | 28.9 | 57 | 46.4 | 48.9 | 48 | 35.1 | 43.4 | |
| Gemini-1.5 FlashType=Proprietary Models2026.05 | 45.7 | 50.8 | 33.6 | 56.5 | 45.2 | 48 | 39.8 | 32.7 | 59.2 | |
| Gemini-1.5-ProModel Category=2D MLLMs2026.03 | 45.4 | 56.2 | 30.9 | 64.1 | 43.6 | 51.3 | 46.3 | 36 | 34.6 | |
| ViLaSR-7BModel Category=2D MLLMs2026.03 | 45.4 | 63.5 | 34.4 | 60.6 | 30.9 | 48.9 | 45.2 | 30.4 | 49.2 | |
| Gemini-2.0 FlashType=Proprietary Models2026.05 | 45.4 | 52.4 | 30.6 | 66.7 | 31.8 | 56 | 46.3 | 24.5 | 55.1 | |
| Gemini-1.5 ProModel Category=Proprietary, Input Frames=8, Zero-shot=true2026.06 | 45.4 | 56.2 | 30.9 | 64.1 | 43.6 | 51.3 | 46.3 | 36 | 34.6 | |
| LLaVA-OneVision-7B + ViSRABase Model=LLaVA-OneVision-7B, Method=ViSRA2026.05 | 45 | 44.5 | 25.8 | 51.3 | 21.9 | 46.9 | 66.5 | 36.1 | 39.3 | |
| Qwen2.5-VL-3B + ViSRABase Model=Qwen2.5-VL-3B, Method=ViSRA2026.05 | 43.1 | 39.9 | 27.3 | 36.9 | 30.4 | 41.1 | 72 | 40.2 | 40.6 | |
| Qwen2.5-VL-3BDataset Source=SV++2026.04 | 42.8 | 61.8 | 30.2 | 49.8 | 43.9 | 49.3 | 47.8 | 33.6 | 26.1 | |
| Gemini-1.5 FlashModel Category=Proprietary, Input Frames=8, Zero-shot=true2026.06 | 42.1 | 49.8 | 30.8 | 53.5 | 54.4 | 37.7 | 41 | 31.5 | 37.8 | |
| Struct2D (7B)Model Category=2D MLLMs2026.03 | 41.9 | 46 | 34.7 | 56.4 | 42.6 | 35.1 | 44.9 | 33.5 | — | |
| TRACEBase Model=MiMo-VL-7B-SFT2026.03 | 41.42 | 33.27 | 31.51 | 58.67 | 41.56 | 39.44 | 35.33 | 28.87 | 51.29 | |
| InternVL3-2B + ViSRABase Model=InternVL3-2B, Method=ViSRA2026.05 | 41.4 | 38.8 | 27.8 | 27.8 | 34.2 | 49.3 | 80.4 | 36.6 | 17.6 | |
| SPAR-8BModel Category=2D MLLMs2026.03 | 41.1 | — | — | — | — | — | — | — | — | |
| DirectBase Model=MiMo-VL-7B-SFT2026.03 | 39.79 | 36.02 | 29.84 | 52.38 | 42.95 | 40.14 | 33.78 | 31.44 | 47.41 | |
| TRACEBase Model=Qwen2.5-VL-72B-Instruct2026.03 | 39.38 | 22.05 | 28.03 | 59.98 | 38.99 | 40.85 | 37.4 | 31.96 | 42.56 | |
| ToTBase Model=MiMo-VL-7B-SFT2026.03 | 39.14 | 29.45 | 30.44 | 54.26 | 40.14 | 41.41 | 32.02 | 32.47 | 46.6 | |
| LtMBase Model=MiMo-VL-7B-SFT2026.03 | 38.34 | 35.09 | 24.47 | 48.22 | 44.48 | 43.1 | 30.79 | 35.05 | 49.5 | |
| ToTBase Model=Qwen2.5-VL-72B-Instruct2026.03 | 38.06 | 17.89 | 26.2 | 53.15 | 47.01 | 41.55 | 36.78 | 35.05 | 44.01 | |
| LtMBase Model=Qwen2.5-VL-72B-Instruct2026.03 | 38.01 | 23.27 | 31.39 | 54.49 | 38.68 | 42.96 | 34.71 | 29.9 | 36.73 | |
| Qwen2.5-VL-7BType=Open-source Base Models2026.05 | 37.6 | 42.9 | 16.6 | 52.7 | 42.2 | 35.5 | 39.6 | 31.4 | 36.7 | |
| CoTBase Model=MiMo-VL-7B-SFT2026.03 | 37.49 | 34.27 | 23.5 | 48.52 | 43.23 | 38.73 | 32.75 | 27.84 | 49.23 | |
| KeyVT on Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Frame Selection=KeyVT (compression), Input Frames=8 (from 16 sampled)2026.06 | 37 | 41.4 | 26.7 | 46 | 34.8 | 31.7 | 38.7 | 35.6 | 40.8 | |
| CMBase Model=MiMo-VL-7B-SFT2026.03 | 36.85 | 27.43 | 23.14 | 50.14 | 39.06 | 41.41 | 32.54 | 27.84 | 46.76 | |
| Qwen2.5-VL-7BDataset Source=-2026.04 | 36.6 | 41.5 | 21 | 50.5 | 36.7 | 38.6 | 41 | 29.4 | 34.5 | |
| FLoC on Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Frame Selection=FLoC (compression), Input Frames=8 (from 16 sampled)2026.06 | 36.6 | 46.7 | 24.8 | 45.3 | 33.2 | 36.3 | 38.5 | 35.1 | 32.1 | |
| DirectBase Model=Qwen2.5-VL-72B-Instruct2026.03 | 36.28 | 33.36 | 20.53 | 49.31 | 41.49 | 43.38 | 27.79 | 32.47 | 44.01 | |
| AKS on Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Frame Selection=AKS, Input Frames=82026.06 | 36.2 | 48 | 23.5 | 47 | 28.9 | 34.1 | 37.6 | 38.1 | 32.4 | |
| DivPrune on Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Frame Selection=DivPrune (compression), Input Frames=8 (from 16 sampled)2026.06 | 36.1 | 46.3 | 25.3 | 45.1 | 31.1 | 33.7 | 38.6 | 36.1 | 33.1 | |
| CMBase Model=Qwen2.5-VL-72B-Instruct2026.03 | 35.47 | 21.58 | 15.67 | 52.65 | 37.26 | 39.44 | 36.05 | 34.54 | 42.39 | |
| InternVL3-8BType=Open-source Base Models2026.05 | 35.2 | 23.1 | 28.7 | 48.2 | 39.8 | 36.7 | 30.7 | 29.9 | 39.6 | |
| LLaVA-OneVision-7BType=Open-source Base Models2026.05 | 35.1 | 47.7 | 14 | 47.4 | 12.3 | 43.5 | 42.4 | 29.4 | 24.4 | |
| InternVL2-8BModel Category=2D MLLMs2026.03 | 34.6 | 23.1 | 28.7 | 48.2 | 39.8 | 36.7 | 30.7 | 29.9 | 39.6 | |
| KeyVT on LLaVAVideo-7BBackbone=LLaVAVideo-7B, Frame Selection=KeyVT (compression), Input Frames=8 (from 16 sampled)2026.06 | 34.6 | 44.5 | 23.8 | 47.1 | 23.6 | 40.1 | 40.9 | 35.6 | 21.4 | |
| GPT-4oModel Category=2D MLLMs2026.03 | 34 | 46.2 | 5.3 | 43.8 | 38.2 | 37 | 41.3 | 31.5 | 28.5 | |
| GPT-4oType=Proprietary Models2026.05 | 34 | 46.2 | 5.3 | 43.8 | 38.2 | 37 | 41.3 | 31.5 | 28.5 | |
| GPT-4oModel Category=Proprietary, Input Frames=8, Zero-shot=true2026.06 | 34 | 46.2 | 5.3 | 43.8 | 38.2 | 37 | 41.3 | 31.5 | 28.5 | |
| FLoC on LLaVAVideo-7BBackbone=LLaVAVideo-7B, Frame Selection=FLoC (compression), Input Frames=8 (from 16 sampled)2026.06 | 34 | 44.1 | 22.2 | 48.7 | 25.7 | 39.4 | 39.2 | 32.5 | 20.3 | |
| KeyVT on LLaVA-OneVision-7BBackbone=LLaVA-OneVision-7B, Frame Selection=KeyVT (compression), Input Frames=8 (from 16 sampled)2026.06 | 33.9 | 46.6 | 20.6 | 48.8 | 26.2 | 38.7 | 38.8 | 29.4 | 21.7 | |
| DivPrune on LLaVA-OneVision-7BBackbone=LLaVA-OneVision-7B, Frame Selection=DivPrune (compression), Input Frames=8 (from 16 sampled)2026.06 | 33.4 | 43.2 | 21.1 | 49.4 | 28.6 | 37.9 | 37.4 | 28.5 | 21 | |
| AKS on LLaVAVideo-7BBackbone=LLaVAVideo-7B, Frame Selection=AKS, Input Frames=82026.06 | 33.2 | 41.8 | 14.6 | 48.6 | 26.8 | 41 | 41.3 | 33 | 18.8 | |
| QWEN2.5-VL-3B + KEYVTBackbone=QWEN2.5-VL-3B, Method Component=KEYVT, Zero-shot evaluation=true2026.06 | 33.2 | 57.1 | 26.7 | 30.9 | 18.6 | 32.4 | 45.8 | 29.4 | 24.4 | |
| FLoC on LLaVA-OneVision-7BBackbone=LLaVA-OneVision-7B, Frame Selection=FLoC (compression), Input Frames=8 (from 16 sampled)2026.06 | 33.1 | 47.1 | 21.2 | 48 | 26.5 | 37.9 | 36.1 | 28.9 | 19.1 | |
| Qwen2.5-VL-7BModel Category=2D MLLMs2026.03 | 33 | 40.9 | 14.8 | 43.4 | 10.7 | 38.6 | 38.5 | 33 | 29.8 | |
| See&Trek on LLaVA-OneVision-7BBackbone=LLaVA-OneVision-7B, Frame Selection=See&Trek, Input Frames=82026.06 | 33 | 32 | 17 | 39.8 | 27.8 | 39 | 40.6 | 31.9 | 35.7 | |
| AKS on LLaVA-OneVision-7BBackbone=LLaVA-OneVision-7B, Frame Selection=AKS, Input Frames=82026.06 | 32.8 | 43.1 | 19.8 | 46.5 | 24.2 | 41.3 | 36.8 | 29.1 | 21.6 | |
| DivPrune on LLaVAVideo-7BBackbone=LLaVAVideo-7B, Frame Selection=DivPrune (compression), Input Frames=8 (from 16 sampled)2026.06 | 32.8 | 39.8 | 15.2 | 49.1 | 25.5 | 39.9 | 40 | 30.9 | 22 | |
| QWEN2.5-VL-3B + FLOCBackbone=QWEN2.5-VL-3B, Method Component=FLOC, Zero-shot evaluation=true2026.06 | 32.5 | 27.1 | 12.3 | 43.6 | 40.2 | 36.9 | 37.7 | 30.4 | 31.6 | |
| LLaVAVideo-7BBackbone=LLaVAVideo-7B, Frame Selection=Native, Input Frames=82026.06 | 32.2 | 40 | 15.1 | 46.8 | 25.2 | 38.9 | 39.4 | 25.7 | 26.5 | |
| LLaVA-OneVision-7BBackbone=LLaVA-OneVision-7B, Frame Selection=Native, Input Frames=82026.06 | 31.4 | 34.7 | 20.6 | 47.3 | 18.1 | 40.4 | 32.4 | 32.5 | 24.9 | |
| QWEN2.5-VL-3B + AKSBackbone=QWEN2.5-VL-3B, Method Component=AKS, Zero-shot evaluation=true2026.06 | 31 | 36.2 | 18.1 | 31.8 | 23.9 | 35.6 | 44.4 | 35.6 | 22.2 | |
| Qwen2.5-VL-3BType=Open-source Base Models2026.05 | 30.5 | 24.3 | 24.7 | 31.7 | 22.6 | 38.3 | 41.6 | 26.3 | 21.2 | |
| QWEN2.5-VL-3B + DIVPRUNEBackbone=QWEN2.5-VL-3B, Method Component=DIVPRUNE, Zero-shot evaluation=true2026.06 | 30.1 | 35.2 | 17.2 | 32.5 | 25.3 | 33.1 | 42.9 | 32 | 22.7 | |
| CoTBase Model=Qwen2.5-VL-72B-Instruct2026.03 | 29.78 | 21.27 | 24.95 | 16.31 | 40.94 | 39.44 | 33.16 | 28.87 | 43.53 | |
| LLAVA-ONEVISION-0.5B + KEYVTBackbone=LLAVA-ONEVISION-0.5B, Method Component=KEYVT, Zero-shot evaluation=true2026.06 | 29.2 | 38.2 | 28.5 | 17.9 | 33 | 30.5 | 42.5 | 35 | 8 | |
| See&Trek on Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Frame Selection=See&Trek, Input Frames=82026.06 | 29 | 13.6 | 14.7 | 35.4 | 23.6 | 33.4 | 41.3 | 30.4 | 39.2 | |
| LLAVA-ONEVISION-0.5B + SEE&TREKBackbone=LLAVA-ONEVISION-0.5B, Method Component=SEE&TREK, Zero-shot evaluation=true2026.06 | 28.7 | 49 | 29.4 | 15.1 | 27.7 | 30.3 | 37.3 | 35.1 | 6.1 | |
| LLAVA-ONEVISION-0.5B + FLOCBackbone=LLAVA-ONEVISION-0.5B, Method Component=FLOC, Zero-shot evaluation=true2026.06 | 28.6 | 57.8 | 31.3 | 10.6 | 13.5 | 27.7 | 39.1 | 35 | 13.9 | |
| Qwen2.5-VL-3BDataset Source=-2026.04 | 27.9 | 25.2 | 17.4 | 16.5 | 26.2 | 37.2 | 45.4 | 28.4 | 27.3 | |
| LLAVA-ONEVISION-0.5B + DIVPRUNEBackbone=LLAVA-ONEVISION-0.5B, Method Component=DIVPRUNE, Zero-shot evaluation=true2026.06 | 27.8 | 54.2 | 31.3 | 10.3 | 13 | 27.9 | 38.9 | 34.5 | 12.3 | |
| InternVL3-2BType=Open-source Base Models2026.05 | 27.5 | 21.8 | 24.9 | 22 | 35 | 33.8 | 44.2 | 30.5 | 7.1 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Frame Selection=Native, Input Frames=82026.06 | 27.3 | 13 | 14.4 | 35.9 | 21.3 | 36.9 | 37.9 | 29.9 | 29.6 | |
| LLAVA-ONEVISION-0.5B + AKSBackbone=LLAVA-ONEVISION-0.5B, Method Component=AKS, Zero-shot evaluation=true2026.06 | 27.2 | 54.4 | 31.3 | 9.5 | 12.9 | 25.9 | 39.2 | 35.1 | 12.4 | |
| LLAVA-ONEVISION-0.5BBackbone=LLAVA-ONEVISION-0.5B, Zero-shot evaluation=true2026.06 | 27.1 | 33.3 | 29.2 | 13 | 29.1 | 29.2 | 40.2 | 36.1 | 6.6 | |
| QWEN2.5-VL-3B + SEE&TREKBackbone=QWEN2.5-VL-3B, Method Component=SEE&TREK, Zero-shot evaluation=true2026.06 | 26.7 | 9.7 | 23.7 | 19 | 22.7 | 33.2 | 47 | 29.4 | 28.8 | |
| QWEN2.5-VL-3BBackbone=QWEN2.5-VL-3B, Zero-shot evaluation=true2026.06 | 25.7 | 15 | 17.4 | 16 | 27 | 35.1 | 44.6 | 29.9 | 21.1 | |
| SAT-LLaVA-Video-7BModel Category=2D MLLMs2026.03 | — | — | — | — | 47.3 | 41.1 | 37.1 | 36.1 | 40.4 |