High-Resolution Multimodal Reasoning on HR-Bench 4K
88.3Overall ScoreTTSP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TTSPBackbone=Qwen3-VL-8B-Instruct2026.04 | 88.3 | 96.8 | 79.8 | |
| DeepconfBackbone=Qwen3-VL-8B-Instruct2026.04 | 86.4 | 96 | 76.8 | |
| RTWIBackbone=Qwen3-VL-8B-Instruct2026.04 | 86.4 | 95.8 | 77 | |
| SCBackbone=Qwen3-VL-8B-Instruct2026.04 | 86.3 | 95.8 | 76.8 | |
| TRTBackbone=Qwen3-VL-8B-Instruct2026.04 | 86.2 | 95.3 | 77 | |
| TTSPBackbone=Qwen3-VL-4B-Instruct2026.04 | 85.8 | 97.3 | 74.3 | |
| CISCBackbone=Qwen3-VL-8B-Instruct2026.04 | 85.7 | 95.5 | 75.8 | |
| Self-Cer.Backbone=Qwen3-VL-8B-Instruct2026.04 | 85.6 | 95.3 | 75.8 | |
| Self-Ref.Backbone=Qwen3-VL-8B-Instruct2026.04 | 85.4 | 93.8 | 77 | |
| RTWIBackbone=Qwen3-VL-4B-Instruct2026.04 | 84.3 | 95.5 | 73 | |
| Self-Ref.Backbone=Qwen3-VL-4B-Instruct2026.04 | 83.9 | 95.3 | 72.5 | |
| DeepconfBackbone=Qwen3-VL-4B-Instruct2026.04 | 83.9 | 95.3 | 72.5 | |
| SCBackbone=Qwen3-VL-4B-Instruct2026.04 | 83.7 | 95 | 72.3 | |
| TRTBackbone=Qwen3-VL-4B-Instruct2026.04 | 83.7 | 95 | 72.3 | |
| CISCBackbone=Qwen3-VL-4B-Instruct2026.04 | 83.6 | 94.8 | 72.3 | |
| Self-Cer.Backbone=Qwen3-VL-4B-Instruct2026.04 | 82.7 | 93 | 72.3 | |
| BaseBackbone=Qwen3-VL-8B-Instruct2026.04 | 81 | 93 | 69 | |
| BaseBackbone=Qwen3-VL-4B-Instruct2026.04 | 80 | 90 | 70 | |
| Mini-o3†Size=7B, Trajectory Free=false, Maximum visual tokens=16,384, Temperature=1.0, Averaging=32 runs2026.03 | 77.5 | — | — | |
| Thyme2026.04 | 77 | 91 | 63 | |
| LFPCSize=7B, Trajectory Free=true, Maximum visual tokens=16,3842026.03 | 76.4 | 92.7 | 60 | |
| LFPCSize=7B, Trajectory Free=true, Maximum visual tokens=1,0242026.03 | 75.3 | 86.8 | 63.7 | |
| DeepEyes‡Size=7B, Trajectory Free=true, Maximum visual tokens=16,384, Shuffle options=false2026.03 | 75.1 | 91.3 | 59 | |
| DeepEyes2026.04 | 75.1 | 91.3 | 59 | |
| Pixel ReasonerSize=7B, Trajectory Free=false, Maximum visual tokens=16,3842026.03 | 73.6 | 85.8 | 61.5 | |
| CoF-sftSize=7B, Trajectory Free=false, Maximum visual tokens=16,3842026.03 | 73 | 92.2 | 53.7 | |
| DeepEyesSize=7B, Trajectory Free=true, Maximum visual tokens=16,3842026.03 | 72.9 | 90.5 | 55.2 | |
| Pixel-Reasoner2026.04 | 72.9 | 86 | 60.3 | |
| V-ReflectionParameter Size=8B2026.03 | 72.6 | 83.5 | 61.8 | |
| DeepeyesParameter Size=-2026.03 | 71.3 | 83.8 | 58.8 | |
| Mini-o3Size=7B, Trajectory Free=false, Maximum visual tokens=1,0242026.03 | 70.7 | 82 | 59.3 | |
| InternVL3Parameter Size=8B2026.03 | 70 | 78.8 | 61.3 | |
| Qwen2.5-VL-7BParameter Size=7B, SFT=vanilla2026.03 | 69.2 | 78.8 | 59.8 | |
| Mini-o3Size=7B, Trajectory Free=false, Maximum visual tokens=16,3842026.03 | 69 | 84 | 54 | |
| Qwen2.5-VL-7BParameter Size=7B2026.03 | 68 | 80.3 | 55.8 | |
| CoF-sftSize=7B, Trajectory Free=false, Maximum visual tokens=1,0242026.03 | 66 | 75.5 | 56.5 | |
| Pixel ReasonerSize=7B, Trajectory Free=false, Maximum visual tokens=1,0242026.03 | 65.8 | 69.8 | 61.8 | |
| GPT-4oParameter Size=-2026.03 | 65 | 66.8 | 63.3 | |
| GPT-4o2026.04 | 65 | 66.8 | 63.3 | |
| DeepEyesSize=7B, Trajectory Free=true, Maximum visual tokens=1,0242026.03 | 63.9 | 73 | 54.7 |