3D Computer Vision Benchmarking on CVBench3D
86AccuracyINTERNVL3-8B + PGT
Evaluation Results
| Method | Links | |
|---|---|---|
| INTERNVL3-8B + PGTBackbone=INTERNVL3-8B, Data=PGT-augmented2026.05 | 86 | |
| INTERNVL3-8BBackbone=INTERNVL3-8B2026.05 | 85.7 | |
| QWEN2.5-VL-7B + PGTBackbone=QWEN2.5-VL-7B, Data=PGT-augmented2026.05 | 84.6 | |
| QWEN2.5-VL-7BBackbone=QWEN2.5-VL-7B2026.05 | 83.5 | |
| IMAGE JIGSAWMethod=IMAGE JIGSAW2026.05 | 83 | |
| QWEN2.5-VL-7B + SPECIALIZED MIXBackbone=QWEN2.5-VL-7B, Data=Specialized Mix2026.05 | 82.5 | |
| THINKLITE-VLMethod=THINKLITE-VL2026.05 | 80.5 | |
| QWEN2.5-VL-3B + SPECIALIZED MIXBackbone=QWEN2.5-VL-3B, Data=Specialized Mix2026.05 | 79.9 | |
| QWEN2.5-VL-3B + PGTBackbone=QWEN2.5-VL-3B, Data=PGT-augmented2026.05 | 79.3 | |
| LLAVA-NEXT-LLAMA3-8B + PGTBackbone=LLAVA-NEXT-LLAMA3-8B, Data=PGT-augmented2026.05 | 77.3 | |
| VIGORL-3BMethod=VIGORL-3B2026.05 | 77.3 | |
| SPATIAL-LADDER-3BMethod=SPATIAL-LADDER-3B2026.05 | 74.9 | |
| JARVISLLM=Qwen2-7B2025.12 | 73 | |
| QWEN2.5-VL-3BBackbone=QWEN2.5-VL-3B2026.05 | 71.5 | |
| LLAVA-NEXT-LLAMA3-8BBackbone=LLAVA-NEXT-LLAMA3-8B2026.05 | 68.3 | |
| Ours w/o MaskingLLM=Qwen2-7B2025.12 | 67.6 | |
| LLaVALLM=Qwen2-7B2025.12 | 66.8 | |
| JARVISLLM=Vicuna-7B2025.12 | 63.8 | |
| LLaVALLM=Vicuna-7B2025.12 | 63.7 | |
| VIRALLLM=Qwen2-7B2025.12 | 62.3 | |
| Ours w/o MaskingLLM=Vicuna-7B2025.12 | 60.8 | |
| VIRALLLM=Vicuna-7B2025.12 | 60 | |
| LLAVA-NEXT-7B + PGTBackbone=LLAVA-NEXT-7B, Data=PGT-augmented2026.05 | 59.9 | |
| LLAVA-NEXT-7BBackbone=LLAVA-NEXT-7B2026.05 | 51.6 |