Geometric Reasoning on Geometry3K (test)
40.93AccuracyDAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPO2026.02 | 40.93 | |
| CalibRL2026.02 | 40.6 | |
| GRPO2026.02 | 39.77 | |
| LUFFY2026.02 | 39.1 | |
| RL-PLUS2026.02 | 36.94 | |
| PEPO_GBackbone=InternVL3-2B-Instruct2026.03 | 31.28 | |
| PEPO_DBackbone=InternVL3-2B-Instruct2026.03 | 31.18 | |
| PEPO_DBackbone=Qwen2.5-VL-3B-Instruct2026.03 | 27.89 | |
| PEPO_GBackbone=Qwen2.5-VL-3B-Instruct2026.03 | 27.27 | |
| DAPOBackbone=Qwen2.5-VL-3B-Instruct2026.03 | 27 | |
| GRPOBackbone=InternVL3-2B-Instruct2026.03 | 26.33 | |
| GRPOBackbone=Qwen2.5-VL-3B-Instruct2026.03 | 23.79 | |
| DAPOBackbone=InternVL3-2B-Instruct2026.03 | 21.57 | |
| SFT+GRPO2026.02 | 18.64 | |
| High-Entropy RLBackbone=Qwen2.5-VL-3B-Instruct2026.03 | 18.26 | |
| BaseBackbone=Qwen2.5-VL-3B-Instruct, Mode=zero-shot2026.03 | 14.25 | |
| BaseBackbone=InternVL3-2B-Instruct, Mode=zero-shot2026.03 | 9.03 | |
| High-Entropy RLBackbone=InternVL3-2B-Instruct2026.03 | 8.3 | |
| Qwen3-VL-7B-Instruct (GeoCode trained)Backbone=Qwen3-VL-7B-Instruct, Training Setting=Ours (GeoCode trained)2026.02 | 0.6007 | |
| Qwen3-VL-7B-Instruct (Baseline)Backbone=Qwen3-VL-7B-Instruct, Training Setting=Baseline2026.02 | 0.5857 | |
| Qwen2.5-VL-7B-Instruct (GeoCode trained)Backbone=Qwen2.5-VL-7B-Instruct, Training Setting=Ours (GeoCode trained)2026.02 | 0.4009 | |
| Qwen2.5-VL-7B-Instruct (Baseline)Backbone=Qwen2.5-VL-7B-Instruct, Training Setting=Baseline2026.02 | 0.339 |