High-Resolution Multimodal Reasoning on HR-Bench 8K
86.4Overall ScoreTTSP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TTSPBackbone=Qwen3-VL-8B-Instruct2026.04 | 86.4 | 95 | 77.8 | |
| RTWIBackbone=Qwen3-VL-8B-Instruct2026.04 | 85.8 | 94.5 | 77 | |
| DeepconfBackbone=Qwen3-VL-8B-Instruct2026.04 | 84.5 | 93.5 | 75.5 | |
| TTSPBackbone=Qwen3-VL-4B-Instruct2026.04 | 84 | 93.5 | 74.5 | |
| SCBackbone=Qwen3-VL-8B-Instruct2026.04 | 83.9 | 93 | 74.8 | |
| TRTBackbone=Qwen3-VL-8B-Instruct2026.04 | 83.9 | 93 | 74.8 | |
| Self-Ref.Backbone=Qwen3-VL-8B-Instruct2026.04 | 83.9 | 93 | 74.8 | |
| RTWIBackbone=Qwen3-VL-4B-Instruct2026.04 | 83.4 | 93 | 73.8 | |
| CISCBackbone=Qwen3-VL-8B-Instruct2026.04 | 83.4 | 91 | 75.8 | |
| DeepconfBackbone=Qwen3-VL-4B-Instruct2026.04 | 83.3 | 92.8 | 73.8 | |
| SCBackbone=Qwen3-VL-4B-Instruct2026.04 | 82.5 | 91.5 | 73.5 | |
| Self-Cer.Backbone=Qwen3-VL-4B-Instruct2026.04 | 82.5 | 91.5 | 73.5 | |
| CISCBackbone=Qwen3-VL-4B-Instruct2026.04 | 82.4 | 91.5 | 73.3 | |
| TRTBackbone=Qwen3-VL-4B-Instruct2026.04 | 82.4 | 91.5 | 73.3 | |
| Self-Ref.Backbone=Qwen3-VL-4B-Instruct2026.04 | 82.4 | 91.3 | 73.5 | |
| Self-Cer.Backbone=Qwen3-VL-8B-Instruct2026.04 | 82.1 | 88.8 | 75.3 | |
| BaseBackbone=Qwen3-VL-8B-Instruct2026.04 | 80.6 | 89.8 | 71.3 | |
| BaseBackbone=Qwen3-VL-4B-Instruct2026.04 | 76.9 | 89.8 | 64 | |
| LFPCSize=7B, Trajectory Free=true, Maximum visual tokens=16,3842026.03 | 75.4 | 87.7 | 63 | |
| Mini-o3†Size=7B, Trajectory Free=false, Maximum visual tokens=16,384, Temperature=1.0, Averaging=32 runs2026.03 | 73.3 | — | — | |
| DeepEyes‡Size=7B, Trajectory Free=true, Maximum visual tokens=16,384, Shuffle options=false2026.03 | 72.6 | 86.8 | 58.5 | |
| DeepEyes2026.04 | 72.6 | 86.8 | 58.5 | |
| LFPCSize=7B, Trajectory Free=true, Maximum visual tokens=1,0242026.03 | 72.1 | 83.3 | 60.8 | |
| Thyme2026.04 | 72 | 86.5 | 57.5 | |
| DeepEyesSize=7B, Trajectory Free=true, Maximum visual tokens=16,3842026.03 | 69.5 | 84.3 | 54.7 | |
| CoF-sftSize=7B, Trajectory Free=false, Maximum visual tokens=16,3842026.03 | 69.4 | 87.7 | 51 | |
| InternVL3Parameter Size=8B2026.03 | 69.3 | 78.8 | 59.8 | |
| Pixel ReasonerSize=7B, Trajectory Free=false, Maximum visual tokens=16,3842026.03 | 66.9 | 78.3 | 55.5 | |
| Pixel-Reasoner2026.04 | 66.9 | 80 | 54.3 | |
| V-ReflectionParameter Size=8B2026.03 | 66.3 | 73.5 | 58.5 | |
| Mini-o3Size=7B, Trajectory Free=false, Maximum visual tokens=1,0242026.03 | 66 | 77.5 | 54.5 | |
| Mini-o3Size=7B, Trajectory Free=false, Maximum visual tokens=16,3842026.03 | 65.6 | 82 | 49.2 | |
| DeepeyesParameter Size=-2026.03 | 65.1 | 77 | 53.3 | |
| Qwen2.5-VL-7BParameter Size=7B, SFT=vanilla2026.03 | 64.5 | 76.8 | 52.3 | |
| Qwen2.5-VL-7BParameter Size=7B2026.03 | 63.8 | 73.8 | 51.8 | |
| DeepEyesSize=7B, Trajectory Free=true, Maximum visual tokens=1,0242026.03 | 62 | 68.8 | 55.2 | |
| Pixel ReasonerSize=7B, Trajectory Free=false, Maximum visual tokens=1,0242026.03 | 59.9 | 62.8 | 57 | |
| GPT-4oParameter Size=-2026.03 | 59.6 | 60.8 | 58.5 | |
| GPT-4o2026.04 | 59.6 | 60.8 | 58.5 | |
| CoF-sftSize=7B, Trajectory Free=false, Maximum visual tokens=1,0242026.03 | 58.9 | 66 | 51.7 |