Visual Puzzle Reasoning on AlgoPuzzleVQA
28.61AccuracyPEPOD
Evaluation Results
| Method | Links | |
|---|---|---|
| PEPODBackbone=InternVL3-2B-Instruct2026.03 | 28.61 | |
| DAPOBackbone=InternVL3-2B-Instruct2026.03 | 27.72 | |
| PEPOGBackbone=InternVL3-2B-Instruct2026.03 | 27.22 | |
| PEPOGBackbone=Qwen2.5-VL-3B-Instruct2026.03 | 26.94 | |
| PEPODBackbone=Qwen2.5-VL-3B-Instruct2026.03 | 26.56 | |
| GRPOBackbone=InternVL3-2B-Instruct2026.03 | 26.17 | |
| GRPOBackbone=Qwen2.5-VL-3B-Instruct2026.03 | 25.44 | |
| DAPOBackbone=Qwen2.5-VL-3B-Instruct2026.03 | 25.33 | |
| High-Entropy RLBackbone=InternVL3-2B-Instruct2026.03 | 25.22 | |
| High-Entropy RLBackbone=Qwen2.5-VL-3B-Instruct2026.03 | 24.61 | |
| Base (zero-shot)Backbone=InternVL3-2B-Instruct2026.03 | 23 | |
| Base (zero-shot)Backbone=Qwen2.5-VL-3B-Instruct2026.03 | 21.72 |