Multimodal Understanding on LLaVA-NeXT Evaluation Suite
100Average AccuracyVanilla
Evaluation Results
| Method | Links | |
|---|---|---|
| VanillaModel Scale=13B, #Tokens=2880, Prefilling Time (ms)=156.5, Total Inference Time (s)=2814, Memory Usage (MB)=368402026.01 | 100 | |
| VisionTrimModel Scale=13B, #Tokens=320, Prefilling Time (ms)=28.0, Total Inference Time (s)=826, Memory Usage (MB)=251302026.01 | 97.4 | |
| VanillaModel Scale=7B, #Tokens=2880, Prefilling Time (ms)=112.4, Total Inference Time (s)=2080, Memory Usage (MB)=208742026.01 | 96.2 | |
| VisionTrimModel Scale=7B, #Tokens=160, Prefilling Time (ms)=15.2, Total Inference Time (s)=547, Memory Usage (MB)=124822026.01 | 94.8 | |
| VisionZipModel Scale=13B, #Tokens=320, Prefilling Time (ms)=57.3, Total Inference Time (s)=1585, Memory Usage (MB)=308622026.01 | 93.3 | |
| VisionZipModel Scale=7B, #Tokens=160, Prefilling Time (ms)=39.8, Total Inference Time (s)=1224, Memory Usage (MB)=170122026.01 | 91.3 |