Multi-modal Understanding on SEED-Bench all (val)
65.6AccuracyLLaVA-Next
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-NextLLM=Vicuna-13B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=2880, PT=558K, SFT=765K2024.06 | 65.6 | |
| DeepStack-L-HDLLM=Vicuna-13B, Eff. Res.=1344, Vis. Tok.=14400, Cxt. Len.=2880, PT=558K, SFT=748K2024.06 | 65.1 | |
| LLaVA-NextLLM=Vicuna-7B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=2880, PT=558K, SFT=765K2024.06 | 64.7 | |
| DeepStack-L-HDLLM=Vicuna-7B, Eff. Res.=1344, Vis. Tok.=14400, Cxt. Len.=2880, PT=558K, SFT=748K2024.06 | 63.6 | |
| DeepStack-LLLM=Vicuna-13B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=576, PT=558K, SFT=665K2024.06 | 63.5 | |
| DeepStack-VLLM=Vicuna-13B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=576, PT=558K, SFT=665K2024.06 | 63 | |
| DeepStack-VLLM=Vicuna-7B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=576, PT=558K, SFT=665K2024.06 | 62.3 | |
| LLaVA-1.5LLM=Vicuna-13B, Eff. Res.=336, Vis. Tok.=576, Cxt. Len.=576, PT=558K, SFT=665K2024.06 | 61.6 | |
| DeepStack-LLLM=Vicuna-7B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=576, PT=558K, SFT=665K2024.06 | 60.6 | |
| Qwen-VL-ChatLLM=Qwen-7B, Eff. Res.=448, Vis. Tok.=256, Cxt. Len.=256, PT=1.4B, SFT=50M2024.06 | 58.2 | |
| Qwen-VLLLM=Qwen-7B, Eff. Res.=448, Vis. Tok.=256, Cxt. Len.=256, PT=1.4B, SFT=50M2024.06 | 56.3 | |
| IDEFICS-9BLLM=LLaMA-7B, Eff. Res.=224, PT=353M, SFT=1M2024.06 | 53.4 | |
| InstructBLIPLLM=Vicuna-13B, Eff. Res.=224, Vis. Tok.=32, Cxt. Len.=32, PT=129M, SFT=1.2M2024.06 | 46.4 | |
| BLIP-2LLM=Vicuna-13B, Eff. Res.=224, Vis. Tok.=32, Cxt. Len.=32, PT=129M, SFT=-2024.06 | 42.5 |