Optical Character Recognition Benchmarking on OCRBench (test)
85.4AccuracyQwen2.5-VL-7B + Q-Zoom
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VL-7B + Q-ZoomThroughput=0.81×, Maximum visual tokens=5762026.04 | 85.4 | |
| Qwen3-VL-4B + Q-ZoomThroughput=0.82×, Maximum visual tokens=5762026.04 | 84.6 | |
| Qwen3-VL-4B + SD-RPNThroughput=0.63×, Maximum visual tokens=5762026.04 | 84.2 | |
| Qwen3-VL-4BThroughput=1.0×, Maximum visual tokens=5762026.04 | 83.1 | |
| Qwen2.5-VL-7B + SD-RPNThroughput=0.50×, Maximum visual tokens=5762026.04 | 82.9 | |
| Qwen2.5-VL-7BThroughput=1.0×, Maximum visual tokens=5762026.04 | 82.8 | |
| Qwen2.5-VL-7B + VisionThinkMaximum visual tokens=5762026.04 | 80.8 | |
| Qwen2.5-VL-3B + Q-ZoomThroughput=0.73×, Maximum visual tokens=5762026.04 | 79.8 | |
| Qwen2.5-VL-7B + AdaptVisionThroughput=0.06×, Maximum visual tokens=5762026.04 | 76.9 | |
| Qwen2.5-VL-3B + SD-RPNThroughput=0.49×, Maximum visual tokens=5762026.04 | 76.3 | |
| Qwen2.5-VL-3BThroughput=1.0×, Maximum visual tokens=5762026.04 | 75.9 | |
| LLaVA-1.5-13B + SD-RPNThroughput=0.64×, Maximum visual tokens=5762026.04 | 39.6 | |
| LLaVA-1.5-13B + Q-ZoomThroughput=0.66×, Maximum visual tokens=5762026.04 | 39.4 | |
| LLaVA-1.5-7B + Q-ZoomThroughput=0.64×, Maximum visual tokens=5762026.04 | 38 | |
| LLaVA-1.5-7B + SD-RPNThroughput=0.62×, Maximum visual tokens=5762026.04 | 37.3 | |
| LLaVA-1.5-13B + S2Throughput=0.71×, Maximum visual tokens=5762026.04 | 36.4 | |
| LLaVA-1.5-13B + ViCropThroughput=0.39×, Maximum visual tokens=5762026.04 | 36.1 | |
| LLaVA-1.5-13BThroughput=1.0×, Maximum visual tokens=5762026.04 | 33.7 | |
| LLaVA-1.5-7B + ViCropThroughput=0.42×, Maximum visual tokens=5762026.04 | 33.2 | |
| LLaVA-1.5-7B + S2Throughput=0.70×, Maximum visual tokens=5762026.04 | 32.6 | |
| LLaVA-1.5-7BThroughput=1.0×, Maximum visual tokens=5762026.04 | 31.4 |