Physical Reasoning on PhyX
48.6AccuracySketchThinker-R1-7B
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SketchThinker-R1-7BMethod Category=Reinforcement-Learning-based, Backbone=Qwen2.5-VL-7B-Instruct2026.01 | 48.6 | 75.3 | 0.645 | — | |
| Vanilla-R1Method Category=Direct Inference, Backbone=Qwen2.5-VL-7B-Instruct2026.01 | 46.7 | 225.1 | 0.207 | — | |
| ThinkPruneMethod Category=Reinforcement-Learning-based, Backbone=Qwen2.5-VL-7B-Instruct2026.01 | 46.3 | 163.7 | 0.283 | — | |
| VeriThinkerMethod Category=Supervised-fine-tuning-based, Backbone=Qwen2.5-VL-7B-Instruct2026.01 | 45.5 | 132.7 | 0.343 | — | |
| L1Method Category=Reinforcement-Learning-based, Backbone=Qwen2.5-VL-7B-Instruct2026.01 | 45.1 | 153.4 | 0.294 | — | |
| C3oTMethod Category=Supervised-fine-tuning-based, Backbone=Qwen2.5-VL-7B-Instruct2026.01 | 43.8 | 117.5 | 0.373 | — | |
| V-STARData Size=40k2026.04 | 42.9 | — | — | — | |
| Constrained CoTMethod Category=Prompt-based, Backbone=Qwen2.5-VL-7B-Instruct2026.01 | 42.4 | 73.4 | 0.578 | — | |
| Chain-of-DraftMethod Category=Prompt-based, Backbone=Qwen2.5-VL-7B-Instruct2026.01 | 42.2 | 85.2 | 0.495 | — | |
| Vision-R1Data Size=210k2026.04 | 41.5 | — | — | — | |
| VL-CogitoData Size=80k2026.04 | 41.5 | — | — | — | |
| ThinkLite-VLData Size=11k2026.04 | 39.7 | — | — | — | |
| OpenVLThinkerData Size=59.2k2026.04 | 39.5 | — | — | — | |
| VL-RethinkerData Size=39k2026.04 | 37.4 | — | — | — | |
| SketchThinker-R1-3BBackbone=Qwen2.5-VL-3B-Instruct, Paradigm=Reinforcement-Learning-based2026.01 | 35.1 | 67.3 | 0.522 | — | |
| Vanilla-R1Backbone=Qwen2.5-VL-3B-Instruct, Paradigm=Direct Inference2026.01 | 34.8 | 173.2 | 0.201 | — | |
| ThinkPruneBackbone=Qwen2.5-VL-3B-Instruct, Paradigm=Reinforcement-Learning-based2026.01 | 33.2 | 82.2 | 0.404 | — | |
| C3oTBackbone=Qwen2.5-VL-3B-Instruct, Paradigm=Supervised-fine-tuning-based2026.01 | 33.1 | 93.2 | 0.355 | — | |
| VeriThinkerBackbone=Qwen2.5-VL-3B-Instruct, Paradigm=Supervised-fine-tuning-based2026.01 | 32.6 | 92.1 | 0.354 | — | |
| Chain-of-DraftBackbone=Qwen2.5-VL-3B-Instruct, Paradigm=Prompt-based2026.01 | 32.5 | 71.2 | 0.456 | — | |
| L1Backbone=Qwen2.5-VL-3B-Instruct, Paradigm=Reinforcement-Learning-based2026.01 | 32.2 | 83.4 | 0.386 | — | |
| R1-OnevisionData Size=155k2026.04 | 32.1 | — | — | — | |
| Constrained CoTBackbone=Qwen2.5-VL-3B-Instruct, Paradigm=Prompt-based2026.01 | 31.5 | 63.6 | 0.495 | — | |
| Qwen2.5VL2026.04 | 30.6 | — | — | — | |
| ECoTModel Category=Vision-Language-Action Models2026.05 | — | — | — | 10.1 | |
| Gemma3-4B-ITModel Category=Vision-Language Models2026.05 | — | — | — | 17.2 | |
| GPT5-nano minimalVariant=nano minimal2025.12 | — | — | — | 24 | |
| MolmoActModel Category=Vision-Language-Action Models2026.05 | — | — | — | 29.7 | |
| Pelican-UnifiedModel Category=Our Unified Model2026.05 | — | — | — | 61.7 | |
| Qwen3-VL 8B-InstructParameters=8B, Type=Instruct2025.12 | — | — | — | 28.3 | |
| Qwen3-VL-30B A3B-InstructParameters=30B A3B, Type=Instruct2025.12 | — | — | — | 31.1 | |
| Qwen3-VL-4B-InstructModel Category=Vision-Language Models2026.05 | — | — | — | 41.1 | |
| Step-GUI-4BParameters=4B2025.12 | — | — | — | 33 | |
| Step-GUI-8BParameters=8B2025.12 | — | — | — | 41.9 | |
| π0.5Model Category=Vision-Language-Action Models2026.05 | — | — | — | 16.2 |