Vision Understanding on CVBench-2D
77.76AccuracyJigsaw + CARE
Evaluation Results
| Method | Links | |
|---|---|---|
| Jigsaw + CAREModel Size=7B2025.12 | 77.76 | |
| Mix + CL + CAREModel Size=7B2025.12 | 76.96 | |
| Jigsaw + CL + CAREModel Size=7B2025.12 | 75.52 | |
| Jigsaw + CLModel Size=7B2025.12 | 75.37 | |
| Rotation + CL + CAREModel Size=7B2025.12 | 75.08 | |
| GRPO-CAREModel Size=7B2025.12 | 74.91 | |
| Visual JigsawModel Size=7B2025.12 | 74.46 | |
| VisualSphinxModel Size=7B2025.12 | 73.98 | |
| Qwen 2.5 VLModel Size=7B2025.12 | 73.62 | |
| Vision-ZeroModel Size=7B2025.12 | 73.53 | |
| PatchFit + CL + CAREModel Size=7B2025.12 | 73.37 | |
| JigsawModel Size=7B2025.12 | 72.13 | |
| ViCritModel Size=7B2025.12 | 70.84 | |
| LLaVA-1.5-13BImage (prefill) Token=576, TFLOPs=19.62024.12 | 62.3 | |
| Dynamic-LLaVA-13B^ITFree=false, Image (prefill) Token=115, TFLOPs=4.72024.12 | 60.7 | |
| LLaVA-FastV (13B)Image (prefill) Token=144, TFLOPs=62024.12 | 58.9 | |
| LLaVA-1.5-7BImage (prefill) Token=576, TFLOPs=10.12024.12 | 58.5 | |
| Dynamic-LLaVA-7B^ITFree=false, Image (prefill) Token=115, TFLOPs=2.52024.12 | 58.3 | |
| LLaVA-1.5-13b+H2Ok-10,-0.5Image (prefill) Token=576, TFLOPs=19.62024.12 | 50.8 | |
| LLaVA-FastV† (7B)Free=false, Image (prefill) Token=144, TFLOPs=3.22024.12 | 49.8 | |
| LLaVA-1.5-7B+H2Ok-10, -0.5Image (prefill) Token=576, TFLOPs=10.12024.12 | 49.7 | |
| LLaVA-HiRED (7B)Free=true, Image (prefill) Token=115, TFLOPs=22024.12 | 44.2 |