Multimodal Understanding on SEED-IMG
71.9AccuracyVanilla 13B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Vanilla 13BModel Scale=13B, Visual Tokens=2880, Multimodal Projector Fine-tuning=false2024.12 | 71.9 | 100 | |
| LLaVA-NeXT Vanilla 13BToken Budget=2880, Avg. Images=4.72, Avg. Tokens=2718.722025.08 | 71.9 | — | |
| Vanilla 7BModel Scale=7B, Visual Tokens=2880, Multimodal Projector Fine-tuning=false2024.12 | 70.2 | 97.6 | |
| MMTokToken Budget=640, Avg. Tokens=6042025.08 | 69.61 | — | |
| DivPruneToken Budget=640, Avg. Tokens=6042025.08 | 69.38 | — | |
| VisionZip ‡Model Scale=13B, Visual Tokens=640, Multimodal Projector Fine-tuning=true2024.12 | 69.2 | 96.2 | |
| VisionZip ✨Token Budget=640, Avg. Tokens=6042025.08 | 69.2 | — | |
| VisionZipModel Scale=13B, Visual Tokens=640, Multimodal Projector Fine-tuning=false2024.12 | 68.8 | 95.7 | |
| VisionZipToken Budget=640, Avg. Tokens=6042025.08 | 68.8 | — | |
| VisionZip ‡Model Scale=13B, Visual Tokens=320, Multimodal Projector Fine-tuning=true2024.12 | 67.9 | 94.4 | |
| VisionZip ✨Token Budget=320, Avg. Tokens=3022025.08 | 67.9 | — | |
| MMTokToken Budget=320, Avg. Tokens=3022025.08 | 67.81 | — | |
| UniTokLLM=LLaMA-2-7B, PT Data Size=70M2025.05 | 67.6 | — | |
| DivPruneToken Budget=320, Avg. Tokens=3022025.08 | 66.75 | — | |
| MMTokToken Budget=160, Avg. Tokens=1512025.08 | 65.45 | — | |
| VisionZipModel Scale=13B, Visual Tokens=320, Multimodal Projector Fine-tuning=false2024.12 | 65.2 | 90.7 | |
| VisionZipToken Budget=320, Avg. Tokens=3022025.08 | 65.2 | — | |
| VisionZip ‡Model Scale=13B, Visual Tokens=160, Multimodal Projector Fine-tuning=true2024.12 | 64.4 | 89.6 | |
| VisionZip ✨Token Budget=160, Avg. Tokens=1512025.08 | 64.4 | — | |
| DivPruneToken Budget=160, Avg. Tokens=1512025.08 | 63.8 | — | |
| Slot-MLLM (14B)LLM=Qwen2.5-14B-Instruct, PT Data Size=25M2025.05 | 62.9 | — | |
| VILA-ULLM=LLaMA-2-7B, PT Data Size=23M2025.05 | 61.9 | — | |
| VisionZipModel Scale=13B, Visual Tokens=160, Multimodal Projector Fine-tuning=false2024.12 | 61.1 | 84.8 | |
| VisionZipToken Budget=160, Avg. Tokens=1512025.08 | 61.1 | — | |
| Slot-MLLM (7B)LLM=Vicuna-7B, PT Data Size=25M2025.05 | 58.7 | — | |
| SEED-LLaMALLM=Vicuna-7B, PT Data Size=77M2025.05 | 48.6 | — | |
| LaVITLLM=LLaMA-7B, PT Data Size=100M2025.05 | 35 | — |