Vision-Centric Perception on RealWorldQA
69.3AccuracyQWEN2.5-VL-7B + PGT
Evaluation Results
| Method | Links | |
|---|---|---|
| QWEN2.5-VL-7B + PGTBackbone=QWEN2.5-VL-7B, Data=PGT-augmented2026.05 | 69.3 | |
| QWEN2.5-VL-7B + SPECIALIZED MIXBackbone=QWEN2.5-VL-7B, Data=Specialized Mix2026.05 | 68.9 | |
| INTERNVL3-8B + PGTBackbone=INTERNVL3-8B, Data=PGT-augmented2026.05 | 68.5 | |
| IMAGE JIGSAWMethod=IMAGE JIGSAW2026.05 | 68.5 | |
| QWEN2.5-VL-7BBackbone=QWEN2.5-VL-7B2026.05 | 67.5 | |
| THINKLITE-VLMethod=THINKLITE-VL2026.05 | 67.5 | |
| INTERNVL3-8BBackbone=INTERNVL3-8B2026.05 | 65.2 | |
| QWEN2.5-VL-3B + PGTBackbone=QWEN2.5-VL-3B, Data=PGT-augmented2026.05 | 62.9 | |
| QWEN2.5-VL-3B + SPECIALIZED MIXBackbone=QWEN2.5-VL-3B, Data=Specialized Mix2026.05 | 62.7 | |
| LLAVA-NEXT-7B + PGTBackbone=LLAVA-NEXT-7B, Data=PGT-augmented2026.05 | 60.1 | |
| LLAVA-NEXT-LLAMA3-8BBackbone=LLAVA-NEXT-LLAMA3-8B2026.05 | 59.5 | |
| LLAVA-NEXT-LLAMA3-8B + PGTBackbone=LLAVA-NEXT-LLAMA3-8B, Data=PGT-augmented2026.05 | 59.5 | |
| QWEN2.5-VL-3BBackbone=QWEN2.5-VL-3B2026.05 | 59 | |
| LLAVA-NEXT-7BBackbone=LLAVA-NEXT-7B2026.05 | 58.4 | |
| SPATIAL-LADDER-3BMethod=SPATIAL-LADDER-3B2026.05 | 52.5 | |
| VIGORL-3BMethod=VIGORL-3B2026.05 | 47.3 |