Multimodal Understanding on MLLM Evaluation Suite (GQA, MME, POPE, SQA, VQAtext, VizWiz, MMBen, AI2D) (test)
64.8GQA ScoreVanilla
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| VanillaBase Model=LLaVA-NeXT-7B, Backbone=Mistral, TFLOPS=40.422026.04 | 64.8 | 1,824 | 86.8 | 78.7 | 65.8 | 63.8 | 68.1 | 67.3 | 100 | |
| VanillaBase Model=LLaVA-1.5v-13B, Backbone=Vicuna, TFLOPS=16.212026.04 | 63.2 | 1,818 | 85.9 | 72.9 | 60.1 | 56.7 | 68.7 | 59.5 | 100 | |
| HalfVBase Model=LLaVA-NeXT-7B, Backbone=Mistral, TFLOPS=11.222026.04 | 62.5 | 1,813 | 87.3 | 78.8 | 64.2 | 62.4 | 68 | 67 | 98.9 | |
| DARTBase Model=LLaVA-NeXT-7B, Backbone=Mistral, TFLOPS=15.032026.04 | 62.4 | 1,789 | 86 | 75.3 | 64.5 | 61.7 | 67.5 | 65.9 | 97.7 | |
| BTPBase Model=LLaVA-1.5v-13B, Backbone=Vicuna, TFLOPS=5.722026.04 | 62.2 | 1,819 | 86.1 | 72.7 | 58.3 | 54.5 | 68 | 58.3 | 98.2 | |
| VanillaBase Model=LLaVA-1.5v-7B, Backbone=Vicuna, TFLOPS=8.312026.04 | 62 | 1,859 | 85.9 | 70.4 | 58.2 | 54.4 | 64.8 | 54.8 | 100 | |
| HalfVBase Model=LLaVA-1.5v-13B, Backbone=Vicuna, TFLOPS=4.812026.04 | 61.6 | 1,831 | 87.2 | 75 | 58 | 55.1 | 68.5 | 59.3 | 99.4 | |
| VanillaBase Model=Qwen25-VL-7B, Backbone=Qwen2.5, TFLOPS=36.632026.04 | 60.7 | 2,307 | 86.5 | 88.7 | 83.2 | 70.6 | 82.5 | 81.4 | 100 | |
| HalfVBase Model=LLaVA-1.5v-7B, Backbone=Vicuna, TFLOPS=3.122026.04 | 60.5 | 1,862 | 86 | 70.2 | 57.6 | 52.9 | 63.7 | 55.6 | 99.2 | |
| HalfVBase Model=Qwen25-VL-7B, Backbone=Qwen2.5, TFLOPS=8.912026.04 | 58.4 | 2,242 | 84.5 | 87 | 76.7 | 68.5 | 81.1 | 79.7 | 96.8 | |
| FastVBase Model=LLaVA-1.5v-7B, Backbone=Vicuna, TFLOPS=3.482026.04 | 57.6 | 1,730 | 81 | 68.9 | 52.5 | 51.3 | 61.6 | 49.7 | 94.6 | |
| HoloVBase Model=Qwen25-VL-7B, Backbone=Qwen2.5, TFLOPS=8.302026.04 | 54.3 | 2,043 | 82.3 | 79.8 | 70.3 | — | 76.5 | 75.6 | 90.5 |