3D Visual Question Answering on OMNI3D BENCH
67.58AccuracyCoVFT
Evaluation Results
| Method | Links | |
|---|---|---|
| CoVFTBackbone=LLaVA-1.5-13B2026.03 | 67.58 | |
| BitFitBackbone=LLaVA-1.5-13B2026.03 | 66.5 | |
| LLaVA-1.5Backbone=LLaVA-1.5-7B2026.03 | 63.25 | |
| Full fine-tuningBackbone=LLaVA-1.5-13B2026.03 | 63.25 | |
| LLaVA-1.5Backbone=LLaVA-1.5-13B2026.03 | 63 | |
| FreezeBackbone=LLaVA-1.5-13B2026.03 | 62.83 | |
| CoVFTBackbone=LLaVA-1.5-7B2026.03 | 61.83 | |
| BitFitBackbone=LLaVA-1.5-7B2026.03 | 60.67 | |
| FreezeBackbone=LLaVA-1.5-7B2026.03 | 60.5 | |
| Full fine-tuningBackbone=LLaVA-1.5-7B2026.03 | 60 | |
| LoRABackbone=LLaVA-1.5-7B2026.03 | 59.83 | |
| SVPTBackbone=LLaVA-1.5-7B2026.03 | 59.29 | |
| VPTBackbone=LLaVA-1.5-7B2026.03 | 58.67 | |
| VALOR2025.12 | 44 | |
| VALORBase Model=Qwen3-8B2025.12 | 44 | |
| VALOR-RLBase Model=Qwen3-8B2025.12 | 43.9 | |
| GPT-5-miniGrounded=false2025.12 | 40.9 | |
| GPT-5-miniGrounded=true2025.12 | 35.5 | |
| GRITBase Model=Qwen2.5-VL-3B2025.12 | 27.3 | |
| ViGoRLBase Model=Qwen2.5-VL-7B2025.12 | 13.2 |