Depth-aware Multimodal Question Answering on Depth Template Benchmark
64.86Scene ClassificationDeepSight-7B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| DeepSight-7BEvaluation Protocol=Fine-tuning, LLM Backbone=7B, Fine-tuning Dataset=Depth Instruction Dataset2026.03 | 64.86 | 40.56 | 63.17 | 44.81 | 53.85 | |
| DeepSight-7BEvaluation Protocol=Fine-tuning, Training Dataset=Depth Instruction Dataset, LLM Backbone=Vicuna1.5-7B2026.03 | 64.86 | 40.56 | 63.17 | 44.81 | 53.85 | |
| LanguageBind-Aligned-7B-FTEvaluation Protocol=Fine-tuning, LLM Backbone=Vicuna1.5-7B, Alignment Strategy=Aligned with Vicuna1.5-7B, Fine-tuning Dataset=Depth Instruction Dataset2026.03 | 62.31 | 36.08 | 57.92 | 37.84 | 48.54 | |
| LanguageBind-Aligned-7B-FTEvaluation Protocol=Fine-tuning, Training Dataset=Depth Instruction Dataset, LLM Backbone=Vicuna1.5-7B2026.03 | 62.31 | 36.08 | 57.92 | 37.84 | 48.54 | |
| ImageBindLLM-7B-FTEvaluation Protocol=Fine-tuning, LLM Backbone=7B, Fine-tuning Dataset=Depth Instruction Dataset2026.03 | 60.19 | 27.33 | 41.82 | 29.78 | 39.28 | |
| ImageBindLLM-7B-FTEvaluation Protocol=Fine-tuning, Training Dataset=Depth Instruction Dataset2026.03 | 60.19 | 27.33 | 41.82 | 29.78 | 39.28 | |
| ImageBindLLM-7BEvaluation Protocol=Zero-shot2026.03 | 58.23 | 23.06 | 28.74 | 22.68 | 33.18 | |
| DeepSight-7BEvaluation Protocol=Zero-shot2026.03 | 57.01 | 28.72 | 39.23 | 29.15 | 38.53 | |
| PandaGPT-7B-FTEvaluation Protocol=Fine-tuning, LLM Backbone=7B, Fine-tuning Dataset=Depth Instruction Dataset2026.03 | 36.92 | 24.38 | 33.12 | 44.06 | 34.62 | |
| PandaGPT-7B-FTEvaluation Protocol=Fine-tuning, Training Dataset=Depth Instruction Dataset2026.03 | 36.92 | 24.38 | 33.12 | 44.06 | 34.62 | |
| PandaGPT-7BEvaluation Protocol=Zero-shot2026.03 | 28.19 | 17.15 | 13.74 | 43.16 | 25.56 |