Visual Perception on HR-Bench
75.12AccuracyVision-R1
Evaluation Results
| Method | Links | |
|---|---|---|
| Vision-R1Paradigm=Tool-use & RL Enhanced Reasoning, Data Size=200K2026.04 | 75.12 | |
| SCF-VRParadigm=Latent Reasoning, Data Size=30K, Backbone=Qwen2.5-VL-7B2026.04 | 74.21 | |
| LaserParadigm=Latent Reasoning, Data Size=267K2026.04 | 72.5 | |
| DeepEyesParadigm=Tool-use & RL Enhanced Reasoning, Data Size=47K2026.04 | 69.12 | |
| Qwen2.5-VL-7BParadigm=Zero-Shot VLMs, Data Size=-2026.04 | 68.25 | |
| PAPOParadigm=Tool-use & RL Enhanced Reasoning, Data Size=39K2026.04 | 68.12 | |
| MonetParadigm=Latent Reasoning, Data Size=125K2026.04 | 68 | |
| VL-RethinkerParadigm=Tool-use & RL Enhanced Reasoning, Data Size=39K2026.04 | 63.5 | |
| LLaVA-OneVisionParadigm=Zero-Shot VLMs, Data Size=9M2026.04 | 63 | |
| InternVL3.5-8BParadigm=Zero-Shot VLMs, Data Size=70K2026.04 | 59.38 | |
| LVRParadigm=Latent Reasoning, Data Size=470K2026.04 | 53.62 |