Visual Reasoning on VisualProbe
42.7ScoreERGO
Evaluation Results
| Method | Links | |
|---|---|---|
| ERGOPixel Constraint=1280x28x28, Post-training Category=Efficiency-oriented Post Training Methods2025.09 | 42.7 | |
| DeepEyesPixel Constraint=1280x28x28, Post-training Category=Non-efficiency-oriented Post Training Methods2025.09 | 39 | |
| MiniO3Pixel Constraint=1280x28x28, Post-training Category=Non-efficiency-oriented Post Training Methods2025.09 | 39 | |
| ERGOPixel Constraint=640x28x28, Post-training Category=Efficiency-oriented Post Training Methods2025.09 | 35 | |
| MGPOPixel Constraint=1280x28x28, Post-training Category=Efficiency-oriented Post Training Methods, Inference Pipeline=reproduction with their code using our data2025.09 | 33.4 | |
| PixelReasonerPixel Constraint=1280x28x28, Post-training Category=Non-efficiency-oriented Post Training Methods2025.09 | 31.8 | |
| MiniO3Pixel Constraint=640x28x28, Post-training Category=Non-efficiency-oriented Post Training Methods2025.09 | 31.7 | |
| MGPOPixel Constraint=640x28x28, Post-training Category=Efficiency-oriented Post Training Methods, Inference Pipeline=reproduction with their code using our data2025.09 | 29.7 | |
| Qwen2.5-VL-7B-Inst.Pixel Constraint=16384x28x282025.09 | 29.2 | |
| DeepEyesPixel Constraint=640x28x28, Post-training Category=Non-efficiency-oriented Post Training Methods2025.09 | 26.8 | |
| TreeVGRPixel Constraint=1280x28x28, Post-training Category=Non-efficiency-oriented Post Training Methods, Inference Pipeline=inference with original pipeline2025.09 | 26.6 | |
| TreeVGRPixel Constraint=640x28x28, Post-training Category=Non-efficiency-oriented Post Training Methods, Inference Pipeline=inference with original pipeline2025.09 | 24.1 | |
| PixelReasonerPixel Constraint=640x28x28, Post-training Category=Non-efficiency-oriented Post Training Methods2025.09 | 23.9 | |
| VisionThinkPixel Constraint=640x28x28, Post-training Category=Efficiency-oriented Post Training Methods, Inference Pipeline=inference with original pipeline2025.09 | 17.9 | |
| VisionThinkPixel Constraint=1280x28x28, Post-training Category=Efficiency-oriented Post Training Methods, Inference Pipeline=inference with original pipeline2025.09 | 17.3 | |
| Qwen2.5-VL-7B-Inst.Pixel Constraint=1280x28x282025.09 | 15.2 | |
| Qwen2.5-VL-7B-Inst.Pixel Constraint=640x28x282025.09 | 10.9 |