General Multi-modal Assistant Task on LLaVA-Bench (LLaVA-B)
77.5ScoreVisionZip
Evaluation Results
| Method | Links | |
|---|---|---|
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=192, Projector Fine-tuning=false2024.12 | 77.5 | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=192, Projector Fine-tuning=true2024.12 | 73.9 | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=128, Projector Fine-tuning=true2024.12 | 72.3 | |
| VanillaBase Model=LLaVA 1.5 13B, Tokens Retained=576, Projector Fine-tuning=false2024.12 | 70.8 | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=128, Projector Fine-tuning=false2024.12 | 70.8 | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=64, Projector Fine-tuning=false2024.12 | 70.3 | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=64, Projector Fine-tuning=true2024.12 | 68.7 |