Multimodal Visual Pattern Recognition on MMVP
75.3MMVP ScorePEARL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PEARLFine-tuning setting=Multiple-type, single tool call, Training data=ThinkMorph data2026.04 | 75.3 | — | |
| PEARLFine-tuning setting=Single-type, single tool call, Training data=LVR data2026.04 | 73.5 | — | |
| LVRFine-tuning setting=Single-type, single tool call, Evaluation steps=4 steps2026.04 | 72 | — | |
| PEARLFine-tuning setting=Single-type, multiple tool calls, Training data=PixelReasoner data2026.04 | 70 | — | |
| IVC-PruneModels=BAGEL-7B, Avg. Tokens=50%2026.05 | 70 | 98.6 | |
| G2TRModels=BAGEL-7B, Avg. Tokens=50%2026.05 | 70 | 99 | |
| VanillaModels=BAGEL-7B, Avg. Tokens=100%2026.05 | 69.3 | 100 | |
| VSCANModels=BAGEL-7B, Avg. Tokens=50%2026.05 | 68.7 | 94.4 | |
| FastVModels=BAGEL-7B, Avg. Tokens=54%2026.05 | 68 | 95.8 | |
| W-FastVModels=BAGEL-7B, Avg. Tokens=54%2026.05 | 67.3 | 95.6 | |
| PixelReasonerFine-tuning setting=Single-type, multiple tool calls2026.04 | 67 | — | |
| Qwen2.5-VL-7B-InstructFine-tuning setting=No fine-tuning2026.04 | 66.7 | — | |
| PDropModels=BAGEL-7B, Avg. Tokens=61%2026.05 | 66.7 | 94.1 | |
| SFTFine-tuning setting=Single-type, single tool call, Training data=LVR data2026.04 | 65.7 | — | |
| CoVTFine-tuning setting=Single-type, single tool call2026.04 | 58.7 | — | |
| VanillaModels=InternVL-U, Avg. Tokens=100%2026.05 | 46 | 100 | |
| VSCANModels=InternVL-U, Avg. Tokens=50%2026.05 | 40 | 92.2 | |
| G2TRModels=InternVL-U, Avg. Tokens=50%2026.05 | 40 | 94.9 | |
| W-FastVModels=InternVL-U, Avg. Tokens=54%2026.05 | 39.3 | 92.3 | |
| IVC-PruneModels=InternVL-U, Avg. Tokens=50%2026.05 | 39 | 93.7 | |
| PDropModels=InternVL-U, Avg. Tokens=61%2026.05 | 38.7 | 92 | |
| FastVModels=InternVL-U, Avg. Tokens=54%2026.05 | 38 | 92.9 | |
| SFTFine-tuning setting=Multiple-type, single tool call, Training data=ThinkMorph data2026.04 | 36.7 | — |