General Perception on MMSTAR
72.3AccuracyTHINKLITE-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| THINKLITE-VLMethod=THINKLITE-VL2026.05 | 72.3 | |
| INTERNVL3-8B + PGTBackbone=INTERNVL3-8B, Data=PGT-augmented2026.05 | 68.5 | |
| INTERNVL3-8BBackbone=INTERNVL3-8B2026.05 | 68.1 | |
| QWEN2.5-VL-7B + PGTBackbone=QWEN2.5-VL-7B, Data=PGT-augmented2026.05 | 63.5 | |
| IMAGE JIGSAWMethod=IMAGE JIGSAW2026.05 | 62.9 | |
| QWEN2.5-VL-7B + SPECIALIZED MIXBackbone=QWEN2.5-VL-7B, Data=Specialized Mix2026.05 | 62.5 | |
| QWEN2.5-VL-7BBackbone=QWEN2.5-VL-7B2026.05 | 62.2 | |
| QWEN2.5-VL-3B + SPECIALIZED MIXBackbone=QWEN2.5-VL-3B, Data=Specialized Mix2026.05 | 56.9 | |
| QWEN2.5-VL-3B + PGTBackbone=QWEN2.5-VL-3B, Data=PGT-augmented2026.05 | 56.5 | |
| QWEN2.5-VL-3BBackbone=QWEN2.5-VL-3B2026.05 | 55.3 | |
| SPATIAL-LADDER-3BMethod=SPATIAL-LADDER-3B2026.05 | 48.9 | |
| LLAVA-NEXT-LLAMA3-8B + PGTBackbone=LLAVA-NEXT-LLAMA3-8B, Data=PGT-augmented2026.05 | 45.3 | |
| LLAVA-NEXT-LLAMA3-8BBackbone=LLAVA-NEXT-LLAMA3-8B2026.05 | 41.5 | |
| VIGORL-3BMethod=VIGORL-3B2026.05 | 37.9 | |
| LLAVA-NEXT-7B + PGTBackbone=LLAVA-NEXT-7B, Data=PGT-augmented2026.05 | 37.1 | |
| LLAVA-NEXT-7BBackbone=LLAVA-NEXT-7B2026.05 | 34.8 |