Optical Character Recognition Evaluation on OCRBench
831ScoreFP16
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FP16Spiking=false, Time Step=N/A, Backbone=Qwen2VL-72B2026.04 | 831 | — | — | |
| VanillaToken Retention Ratio=100%2026.05 | 822 | — | — | |
| SpikeMLLM (QuaRot+MSTS+TC-LIF)Spiking=true, Time Step=3/4, Backbone=Qwen2VL-72B2026.04 | 817 | — | — | |
| SPprunerToken Retention Ratio=70%2026.05 | 814 | — | — | |
| DARTToken Retention Ratio=70%2026.05 | 805 | — | — | |
| SPprunerToken Retention Ratio=50%2026.05 | 798 | — | — | |
| SpikeMLLM(MBQ)Spiking=true, Time Step=255, Backbone=Qwen2VL-72B2026.04 | 791 | — | — | |
| DARTToken Retention Ratio=50%2026.05 | 751 | — | — | |
| FastVToken Retention Ratio=70%2026.05 | 711 | — | — | |
| SPprunerToken Retention Ratio=30%2026.05 | 704 | — | — | |
| SpikeMLLM(SQ)Spiking=true, Time Step=255, Backbone=Qwen2VL-72B2026.04 | 678 | — | — | |
| FastVToken Retention Ratio=50%2026.05 | 632 | — | — | |
| DARTToken Retention Ratio=30%2026.05 | 628 | — | — | |
| FastVToken Retention Ratio=30%2026.05 | 510 | — | — | |
| VanillaBackbone=LLaVA-1.5-13B, Tokens=322026.01 | 331 | 100 | 2,394 | |
| VisionTrimBackbone=LLaVA-1.5-13B, Tokens=322026.01 | 297 | 96.3 | 704 | |
| VisionZipBackbone=LLaVA-1.5-13B, Tokens=322026.01 | 165 | 71.4 | 1,096 | |
| Ovis-U1#LLM=1.5B2025.12 | 88.3 | — | — | |
| InternVL3Input=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 88 | — | — | |
| Qwen2-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 86.6 | — | — | |
| STAR-7B#LLM=7B2025.12 | 86.4 | — | — | |
| Qwen2.5-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 86.4 | — | — | |
| Encoder-BasedInput=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 85.3 | — | — | |
| Qwen3-VLparameters=8B2026.01 | 84.9 | — | — | |
| InternVL3Input=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 83.5 | — | — | |
| Encoder-BasedInput=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 83.5 | — | — | |
| LLaVA-OVversion=1.5, parameters=8B2026.01 | 82.5 | — | — | |
| InternVL2.5Input=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 82.2 | — | — | |
| MiniCPM-Vversion=4.5, parameters=8B2026.01 | 81.5 | — | — | |
| Qwen2-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 80.9 | — | — | |
| InternVL2.5Input=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 80.4 | — | — | |
| Intern-S1variant=mini, parameters=9B2026.01 | 80.2 | — | — | |
| Mono-InternVL-1.5Input=Tile-wise, RoPE=1D-RoPE, Backbone=DaC, Parameter Scale=2B2025.10 | 80.1 | — | — | |
| Innovator-VLvariant=8B-Instruct, parameters=8B2026.01 | 80 | — | — | |
| InternVL3.5parameters=8B2026.01 | 80 | — | — | |
| STAR-3B#LLM=3B2025.12 | 79.7 | — | — | |
| Qwen2.5-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 79.7 | — | — | |
| Innovator-VLvariant=8B-Thinking, parameters=8B2026.01 | 79.3 | — | — | |
| SAILInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 78.3 | — | — | |
| MiMo-VLtraining=7B-RL, parameters=7B2026.01 | 78 | — | — | |
| NEOInput=Any Res., RoPE=Native-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 77.7 | — | — | |
| NEOInput=Any Res., RoPE=Native-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 77.1 | — | — | |
| MiMo-VLtraining=7B-SFT, parameters=7B2026.01 | 76.9 | — | — | |
| Mono-InternVLInput=Tile-wise, RoPE=1D-RoPE, Backbone=MoE, Parameter Scale=2B2025.10 | 76.7 | — | — | |
| HoVLEInput=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 74 | — | — | |
| X-Omni#LLM=7B2025.12 | 70.4 | — | — | |
| EVEv2Input=Any Rat., RoPE=1D-RoPE, Backbone=DaC, Parameter Scale=8B2025.10 | 70.2 | — | — | |
| EMU3#LLM=8B2025.12 | 68.7 | — | — | |
| Emu3Input=Fix Res., RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 68.7 | — | — | |
| ILLUME+#LLM=3B2025.12 | 67.2 | — | — | |
| Qwen3-VL-8B-ThinkingStrategy=LongCoT2026.02 | 65.9 | — | — | |
| SAPStrategy=SAP2026.02 | 60.2 | — | — | |
| Qwen3-VL-8B-InstructStrategy=Instruct2026.02 | 56.8 | — | — | |
| EVEInput=Any Rat., RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 39.8 | — | — | |
| FuyuInput=Any Res., RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 36.6 | — | — | |
| GRIP+decoder+rlBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=rl, Pruning Component=decoder2026.05 | 31.7 | — | — | |
| GRIP+decoder+slBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=sl, Pruning Component=decoder2026.05 | 31.6 | — | — | |
| OriginalBackbone=LLaVA-1.5-7B, Token Budget=Full2026.05 | 31.3 | — | — | |
| VisionZipBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 31.2 | — | — | |
| GRIP+encoder+slBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=sl, Pruning Component=encoder2026.05 | 30.9 | — | — | |
| SparseVLMBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 30.7 | — | — | |
| VisprunerBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 30.6 | — | — | |
| GRIP+encoder+rlBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=rl, Pruning Component=encoder2026.05 | 30.6 | — | — | |
| DivPruneBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 30.4 | — | — | |
| DARTBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 30 | — | — | |
| VisionZipBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 29.8 | — | — | |
| GRIP+encoder+slBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=sl, Pruning Component=encoder2026.05 | 29.8 | — | — | |
| GRIP+encoder+rlBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=rl, Pruning Component=encoder2026.05 | 29.5 | — | — | |
| VisprunerBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 29 | — | — | |
| DivPruneBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 28.8 | — | — | |
| GRIP+encoder+slBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=sl, Pruning Component=encoder2026.05 | 28.6 | — | — | |
| PruneSIDBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 28.3 | — | — | |
| GRIP+decoder+slBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=sl, Pruning Component=decoder2026.05 | 28.2 | — | — | |
| VisionZipBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 28.2 | — | — | |
| SparseVLMBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 28.1 | — | — | |
| GRIP+decoder+rlBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=rl, Pruning Component=decoder2026.05 | 28.1 | — | — | |
| GRIP+encoder+rlBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=rl, Pruning Component=encoder2026.05 | 28 | — | — | |
| VisprunerBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 27.9 | — | — | |
| DARTBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 27.5 | — | — | |
| PruneSIDBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 27.5 | — | — | |
| PruneSIDBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 27.4 | — | — | |
| DivPruneBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 27.1 | — | — | |
| GRIP+decoder+rlBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=rl, Pruning Component=decoder2026.05 | 22.8 | — | — | |
| DARTBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 21.4 | — | — | |
| SparseVLMBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 21.2 | — | — | |
| GRIP+decoder+slBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=sl, Pruning Component=decoder2026.05 | 21.2 | — | — | |
| SOLOInput=Any Res., RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 12.6 | — | — | |
| DeepEyes2025.12 | 0.846 | — | — | |
| SubagentVL2025.12 | 0.845 | — | — | |
| Qwen2.5-VL2025.12 | 0.844 | — | — | |
| ChameleonInput=Fix Res., RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 0.7 | — | — |