Document Visual Question Answering on DocVQA (Accuracy & Latency)
97.1AccuracyQwen3-VL-32B-Instruct + SpatialBoost
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-VL-32B-Instruct + SpatialBoostEncoder Enhancement=SpatialBoost2026.03 | 97.1 | — | — | |
| Qwen3-VL-32B-Instruct2026.03 | 96.9 | — | — | |
| Penguin-VLModel Size=8B2026.03 | 96.2 | — | — | |
| Qwen3-VLModel Size=8B2026.03 | 96.1 | — | — | |
| FP16Spiking=false, Time Step=N/A, Backbone=Qwen2VL-72B2026.04 | 95.94 | — | — | |
| Qwen3-VL-8BModel Category=Open-source General Models2025.11 | 95.8 | — | — | |
| SpikeMLLM (QuaRot+MSTS+TC-LIF)Spiking=true, Time Step=3/4, Backbone=Qwen2VL-72B2026.04 | 95.54 | — | — | |
| InternVL3-38B2026.03 | 95.4 | — | — | |
| InternVL3-38B + SpatialBoostEncoder Enhancement=SpatialBoost2026.03 | 95.4 | — | — | |
| SenseNova-SIBase Architecture=Qwen3-VL-8B, Model Category=Ours2025.11 | 95.4 | — | — | |
| Qwen3-VL-4B-InstructParameters=4B2026.03 | 95.3 | — | — | |
| LaV-CoTModel Scale=3B, Training/Optimization Strategy=SFT+GRPO2025.09 | 95 | — | — | |
| Gemini-2.5-flash2025.09 | 94.9 | — | — | |
| LaV-CoTModel Scale=3B, Training/Optimization Strategy=SFT2025.09 | 94.5 | — | — | |
| SpikeMLLM(MBQ)Spiking=true, Time Step=255, Backbone=Qwen2VL-72B2026.04 | 94.41 | — | — | |
| GPT-4o-2024-05-132025.09 | 94.4 | — | — | |
| BaselineModel=Llama Nemotron Nano 12B v2 VL2026.01 | 94.3 | — | — | |
| AndesVLNumber of Parameters=2.4B2025.12 | 94.2 | — | — | |
| Bagel-7B-MoTModel Category=Open-source General Models2025.11 | 94.1 | — | — | |
| Qwen2.5-VLModel Scale=7B2025.09 | 94.1 | — | — | |
| FP16Model=Qwen2VL-7B, Spiking=false, Time Step=N/A2026.04 | 93.95 | — | — | |
| QADModel=Llama Nemotron Nano 12B v2 VL2026.01 | 93.9 | — | — | |
| SenseNova-SIBase Architecture=Bagel-7B-MoT, Model Category=Ours2025.11 | 93.9 | — | — | |
| Qwen2.5-VLModel Scale=3B2025.09 | 93.9 | — | — | |
| PTQModel=Llama Nemotron Nano 12B v2 VL2026.01 | 93.8 | — | — | |
| QATModel=Llama Nemotron Nano 12B v2 VL2026.01 | 93.7 | — | — | |
| SpikeMLLM(QuaRot+MSTS+TC-LIF)Model=Qwen2VL-7B, Spiking=true, Time Step=3/42026.04 | 93.31 | — | — | |
| Qwen3-VLNumber of Parameters=2.1B2025.12 | 93.3 | — | — | |
| Qwen3-VL-2B-InstructParameters=2B2026.03 | 93.3 | — | — | |
| SAIL-VL2Number of Parameters=2.7B2025.12 | 93.1 | — | — | |
| SpikeMLLM(QuaRot)Model=Qwen2VL-7B, Spiking=true, Time Step=152026.04 | 92.5 | — | — | |
| ToolTreeBackbone Model=GPT-4o2026.03 | 92.33 | — | — | |
| InternVL-3.5Model Size=8B2026.03 | 92.3 | — | — | |
| HyperVL ViTLNumber of Parameters=2.0B2025.12 | 92.2 | — | — | |
| Qwen3-VL-8B-InstructStrategy=Instruct2026.02 | 92.2 | — | — | |
| InternVL3-8BModel Category=Open-source General Models2025.11 | 92.1 | — | — | |
| dots.mocrParameters=3B2026.03 | 91.85 | — | — | |
| VST-7B-SFTModel Category=Open-source SI Models2025.11 | 91.7 | — | — | |
| SAIL-VL1.5Number of Parameters=2.5B2025.12 | 91.6 | — | — | |
| Qwen3-VL-8B-ThinkingStrategy=LongCoT2026.02 | 91.6 | — | — | |
| HyperVLNumber of Parameters=1.8B2025.12 | 91.3 | — | — | |
| FP16Model=InternVL2-8B, Spiking=false, Time Step=N/A2026.04 | 91.05 | — | — | |
| SAPStrategy=SAP2026.02 | 90.6 | — | — | |
| Qwen2-VLNumber of Parameters=2.2B2025.12 | 90.1 | — | — | |
| FP16Model=MiniCPM-V-2.6-8B, Spiking=false, Time Step=N/A2026.04 | 89.93 | — | — | |
| SpikeMLLM(QuaRot+MSTS+TC-LIF)Model=InternVL2-8B, Spiking=true, Time Step=3/42026.04 | 89.85 | — | — | |
| SpikeMLLM(GPTQ)Model=Qwen2VL-7B, Spiking=true, Time Step=2552026.04 | 89.71 | — | — | |
| Ovis2Number of Parameters=2.5B2025.12 | 89.6 | — | — | |
| Claude-3-SonnetTable Header=Claude-S2026.02 | 89.5 | — | — | |
| ToolTreeBackbone Model=GPT-4o-mini2026.03 | 89.43 | — | — | |
| InternVL3.5Number of Parameters=2.3B2025.12 | 89.4 | — | — | |
| OctoToolsBackbone Model=GPT-4o2026.03 | 89.39 | — | — | |
| Claude-3-OpusTable Header=Claude-O2026.02 | 89.3 | — | — | |
| SpikeMLLM(QuaRot)Model=InternVL2-8B, Spiking=true, Time Step=152026.04 | 88.92 | — | — | |
| SpikeMLLM(QuaRot+MSTS+TC-LIF)Model=MiniCPM-V-2.6-8B, Spiking=true, Time Step=3/42026.04 | 88.8 | — | — | |
| GPT-4V2026.02 | 88.4 | — | — | |
| GPT-4VLanguage Model Scale=Large, Training Data Scale=Large2025.01 | 88.4 | — | — | |
| Llama 3.2-11BLanguage Model Scale=11B, Training Data Scale=Large2025.01 | 88.4 | — | — | |
| InternVL3Number of Parameters=2.1B2025.12 | 88.3 | — | — | |
| SpikeMLLM(GPTQ)Model=MiniCPM-V-2.6-8B, Spiking=true, Time Step=2552026.04 | 87.62 | — | — | |
| InternVL3-2BModel Category=Open-source General Models2025.11 | 87.3 | — | — | |
| Few-ShotBackbone Model=GPT-4o2026.03 | 87.11 | — | — | |
| SpikeMLLM(QuaRot)Model=MiniCPM-V-2.6-8B, Spiking=true, Time Step=152026.04 | 87.04 | — | — | |
| DualPDBackbone=Qwen-2.5-VL-7B, Decoding Strategy=DualPD2026.01 | 86.8 | — | — | |
| Gemini-1.52026.02 | 86.5 | — | — | |
| DualPDBackbone=Qwen-2-VL-7B, Decoding Strategy=DualPD2026.01 | 85.78 | — | — | |
| SpikeMLLM(GPTQ)Model=InternVL2-8B, Spiking=true, Time Step=2552026.04 | 85.61 | — | — | |
| Grok-1.5V2026.02 | 85.6 | — | — | |
| Qwen-2-VL-7BBackbone=Qwen-2-VL-7B, Decoding Strategy=Standard2026.01 | 85.56 | — | — | |
| AttWarp-ChainBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Adaptive Chains2025.10 | 85.3 | — | — | |
| SenseNova-SIBase Architecture=InternVL3-2B, Model Category=Ours2025.11 | 85.2 | — | — | |
| DoLABackbone=Qwen-2.5-VL-7B, Decoding Strategy=DoLA2026.01 | 85.03 | — | — | |
| Qwen-2.5-VL-7BBackbone=Qwen-2.5-VL-7B, Decoding Strategy=Standard2026.01 | 84.94 | — | — | |
| SenseNova-SIBase Architecture=InternVL3-8B, Model Category=Ours2025.11 | 84.9 | — | — | |
| SpikeMLLM(RTN)Model=MiniCPM-V-2.6-8B, Spiking=true, Time Step=2552026.04 | 84.6 | — | — | |
| Qwen 2.5 VL + CropVLMBase Model=Qwen 2.5 VL, Cropping Strategy=CropVLM, Input Resolution=2048x20482025.11 | 84.41 | — | — | |
| DoLABackbone=Qwen-2-VL-7B, Decoding Strategy=DoLA2026.01 | 84.23 | — | — | |
| OctoToolsBackbone Model=GPT-4o-mini2026.03 | 84.23 | — | — | |
| SpikeMLLM(QuaRot+MSTS+TC-LIF)Model=Qwen2VL-7B, Spiking=true, Time Step=2/32026.04 | 84.2 | — | — | |
| AttWarpBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Rectilinear warping2025.10 | 84.1 | — | — | |
| Cambrian-S-7BModel Category=Open-source SI Models2025.11 | 83.7 | — | — | |
| SpikeMLLM(SQ)Spiking=true, Time Step=255, Backbone=Qwen2VL-72B2026.04 | 83.5 | — | — | |
| Few-ShotBackbone Model=GPT-4o-mini2026.03 | 83.28 | — | — | |
| HuggingGPTBackbone Model=GPT-4o-mini2026.03 | 83.1 | — | — | |
| ViCropBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Add object crop2025.10 | 82.5 | — | — | |
| HuggingGPTBackbone Model=GPT-4o2026.03 | 82.13 | — | — | |
| AttWarp-DistillBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Efficient inference2025.10 | 81.8 | — | — | |
| SpikeMLLM(QuaRot+MSTS+TC-LIF)Model=InternVL2-8B, Spiking=true, Time Step=2/32026.04 | 80.39 | — | — | |
| LeoLanguage Model Scale=7B, Training Data Scale=Standard2025.01 | 80.1 | — | — | |
| OpenAI GPT-5 nanoModel Size=nano2026.03 | 78.3 | — | — | |
| SpikeMLLM(RTN)Model=InternVL2-8B, Spiking=true, Time Step=2552026.04 | 77.71 | — | — | |
| PaliGemma2-3B + AuditDMResolution=448x448, Fine-tuning=per-task2025.12 | 77.5 | — | — | |
| Base MLLMBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Cross-attention VL adapter & partially closed data2025.10 | 77.3 | — | — | |
| PaliGemma2-10BResolution=448x448, Fine-tuning=per-task2025.12 | 76.6 | — | — | |
| Qwen 2.5 VL + UV-CoTBase Model=Qwen 2.5 VL, Cropping Strategy=UV-CoT, Input Resolution=336x3362025.11 | 76.6 | — | — | |
| SpikeMLLM(QuaRot+MSTS+TC-LIF)Model=MiniCPM-V-2.6-8B, Spiking=true, Time Step=2/32026.04 | 76.35 | — | — | |
| PaliGemma2-28BResolution=448x448, Fine-tuning=per-task2025.12 | 76.1 | — | — | |
| Cambrian-1-34BLanguage Model Scale=34B, Training Data Scale=Large2025.01 | 75.5 | — | — | |
| SpikeMLLM(RTN)Model=Qwen2VL-7B, Spiking=true, Time Step=2552026.04 | 75.04 | — | — | |
| PaliGemma2-3BResolution=448x448, Fine-tuning=per-task2025.12 | 73.6 | — | — |