Multimodal Understanding on MMMU (Accuracy, Token Count, EoT)
55.9AccuracySketchThinker-R1-3B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SketchThinker-R1-3BBackbone=Qwen2.5-VL-3B-Instruct, Paradigm=Reinforcement-Learning-based2026.01 | 55.9 | 54.5 | 1.026 | |
| Vanilla-R1Backbone=Qwen2.5-VL-3B-Instruct, Paradigm=Direct Inference2026.01 | 54.8 | 128.3 | 0.427 | |
| C3oTBackbone=Qwen2.5-VL-3B-Instruct, Paradigm=Supervised-fine-tuning-based2026.01 | 54.1 | 107.5 | 0.503 | |
| Chain-of-DraftBackbone=Qwen2.5-VL-3B-Instruct, Paradigm=Prompt-based2026.01 | 53.8 | 72.1 | 0.746 | |
| L1Backbone=Qwen2.5-VL-3B-Instruct, Paradigm=Reinforcement-Learning-based2026.01 | 53.7 | 102.6 | 0.523 | |
| ThinkPruneBackbone=Qwen2.5-VL-3B-Instruct, Paradigm=Reinforcement-Learning-based2026.01 | 53.2 | 95.2 | 0.559 | |
| Constrained CoTBackbone=Qwen2.5-VL-3B-Instruct, Paradigm=Prompt-based2026.01 | 52.7 | 76.2 | 0.692 | |
| VeriThinkerBackbone=Qwen2.5-VL-3B-Instruct, Paradigm=Supervised-fine-tuning-based2026.01 | 52.2 | 95.8 | 0.545 |