Vision Understanding on SEED
68.2AccuracyLLaVA-1.5-13B
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-1.5-13BImage (prefill) Token=576, TFLOPs=19.62024.12 | 68.2 | |
| Dynamic-LLaVA-13B^VFree=false, Image (prefill) Token=115, TFLOPs=4.72024.12 | 66.6 | |
| Dynamic-LLaVA-13B^ITFree=false, Image (prefill) Token=115, TFLOPs=4.72024.12 | 66.5 | |
| LLaVA-1.5-7BImage (prefill) Token=576, TFLOPs=10.12024.12 | 66.1 | |
| SeGroSFine-Tuning=Ours2026.03 | 65.5 | |
| LLaVA-FastV (13B)Image (prefill) Token=144, TFLOPs=62024.12 | 65.4 | |
| Base ModelFine-Tuning=w/o SFT2026.03 | 65.2 | |
| SFTFine-Tuning=SFT2026.03 | 65.1 | |
| RecaFine-Tuning=Reca2026.03 | 65.1 | |
| Dynamic-LLaVA-7B^ITFree=false, Image (prefill) Token=115, TFLOPs=2.52024.12 | 65 | |
| Dynamic-LLaVA-7B^VFree=false, Image (prefill) Token=115, TFLOPs=2.52024.12 | 64.6 | |
| LLaVA-FastV (7B)Free=true, Image (prefill) Token=144, TFLOPs=3.22024.12 | 62.8 | |
| LLaVA-FastV† (7B)Free=false, Image (prefill) Token=144, TFLOPs=3.22024.12 | 58.4 | |
| LLaVA-1.5-13b+H2Ok-10,-0.5Image (prefill) Token=576, TFLOPs=19.62024.12 | 32.3 | |
| LLaVA-1.5-7B+H2Ok-10, -0.5Image (prefill) Token=576, TFLOPs=10.12024.12 | 26.8 |