Geometric Reasoning on Geometry3K
69.1Accuracy@1VL-Cogito-7B + LEAD
Evaluation Results
| Method | Links | |
|---|---|---|
| VL-Cogito-7B + LEADBackbone=VL-Cogito-7B, Decoding Strategy=LEAD2026.03 | 69.1 | |
| VL-Rethinker-7B + LEADBackbone=VL-Rethinker-7B, Decoding Strategy=LEAD2026.03 | 68.9 | |
| VL-Cogito-7BBackbone=VL-Cogito-7B2026.03 | 68.7 | |
| Vision-R1-7B + LEADBackbone=Vision-R1-7B, Decoding Strategy=LEAD2026.03 | 68.3 | |
| VL-Rethinker-7BBackbone=VL-Rethinker-7B2026.03 | 67.7 | |
| Vision-R1-7BBackbone=Vision-R1-7B2026.03 | 67 | |
| R1-Onevision-7B + LEADBackbone=R1-Onevision-7B, Decoding Strategy=LEAD2026.03 | 61.2 | |
| R1-Onevision-7BBackbone=R1-Onevision-7B2026.03 | 57.9 | |
| NoisyRollout-7BModel Size=7B, Training Set=Geo3k2026.04 | 51.98 | |
| Qwen2.5-VL-7B + PGPOModel Size=7B, Optimization Strategy=PGPO2026.04 | 45.2 | |
| Qwen2.5-VL-7B + VPPOModel Size=7B, Optimization Strategy=VPPO2026.04 | 44.38 | |
| Qwen2.5-VL-7B + PAPOModel Size=7B, Optimization Strategy=PAPO2026.04 | 43.97 | |
| VisuoThinkBackbone=Claude-3.5-sonnet2025.04 | 43.8 | |
| VisualSketchpad + Equation SolverBackbone=Claude-3.5-sonnet2025.04 | 41.7 | |
| Qwen2.5-VL-7B + DAPOModel Size=7B, Optimization Strategy=DAPO2026.04 | 41.47 | |
| R1-ShareVL-7BModel Size=7B2026.04 | 41.2 | |
| VL-Rethinker-7BModel Size=7B2026.04 | 40.7 | |
| MM-Eureka-7BModel Size=7B2026.04 | 40.3 | |
| VisualSketchpadBackbone=Claude-3.5-sonnet2025.04 | 39.6 | |
| CoTBackbone=Claude-3.5-sonnet2025.04 | 37.5 | |
| VisuoThink w/o rollout searchBackbone=Claude-3.5-sonnet2025.04 | 37.5 | |
| Qwen2.5-VL-7BModel Size=7B2026.04 | 37.29 | |
| Qwen2.5-VL-3B + PGPOModel Size=3B, Optimization Strategy=PGPO2026.04 | 36.11 | |
| Qwen2.5-VL-3B + VPPOModel Size=3B, Optimization Strategy=VPPO2026.04 | 35.36 | |
| Qwen2.5-VL-3B + PAPOModel Size=3B, Optimization Strategy=PAPO2026.04 | 35.11 | |
| Qwen2.5-VL-3B + DAPOModel Size=3B, Optimization Strategy=DAPO2026.04 | 33.8 | |
| VisuoThinkBackbone=GPT-4o2025.04 | 33.3 | |
| Qwen2.5-VL-3B + GRPOModel Size=3B, Optimization Strategy=GRPO2026.04 | 32.19 | |
| Qwen2.5-VL-7B + GRPOModel Size=7B, Optimization Strategy=GRPO2026.04 | 30.91 | |
| GeoSketch-Qwen2.5VL-7BTraining Stage=RL2025.09 | 28.79 | |
| VisuoThink w/o rollout searchBackbone=GPT-4o2025.04 | 27.1 | |
| VisualSketchpad + Equation SolverBackbone=GPT-4o2025.04 | 25 | |
| VisuoThinkBackbone=Qwen2-VL-72B-Instruct2025.04 | 25 | |
| VisualSketchPadBackbone=GPT-4o2025.04 | 22.9 | |
| GeoSketch-Qwen2.5VL-7BTraining Stage=SFT2025.09 | 22.46 | |
| CoTBackbone=GPT-4o2025.04 | 20.8 | |
| VisuoThink w/o rollout searchBackbone=Qwen2-VL-72B-Instruct2025.04 | 20.8 | |
| Qwen2.5-VL-3BModel Size=3B2026.04 | 19.65 | |
| Qwen2.5VL-7BMode=Base2025.09 | 19.3 | |
| CoTBackbone=Qwen2-VL-72B-Instruct2025.04 | 18.8 | |
| VisualSketchpadBackbone=Qwen2-VL-72B-Instruct2025.04 | 17 | |
| VisualSketchpad + Equation SolverBackbone=Qwen2-VL-72B-Instruct2025.04 | 14.9 |