Multi-modal Understanding on SEED-IMG I
66.9AccuracyVanilla
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VanillaBase Model=LLaVA 1.5 13B, Tokens Retained=576, Projector Fine-tuning=false2024.12 | 66.9 | — | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=192, Projector Fine-tuning=true2024.12 | 66.1 | — | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=192, Projector Fine-tuning=false2024.12 | 65.2 | — | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=128, Projector Fine-tuning=true2024.12 | 64.9 | — | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=128, Projector Fine-tuning=false2024.12 | 63.8 | — | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=64, Projector Fine-tuning=true2024.12 | 61.4 | — | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=64, Projector Fine-tuning=false2024.12 | 60.4 | — |