High-Resolution Multimodal Understanding on HRBench 8K
71.5AccuracyDefender
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DefenderIteration=32026.01 | 71.5 | 58 | 85 | |
| Base (M_def^(0)) + Clean DataData=Cleaned2026.01 | 70.62 | 57 | 84.25 | |
| DefenderIteration=22026.01 | 69.88 | 56.25 | 83.5 | |
| DefenderIteration=12026.01 | 69.38 | 55.25 | 83.5 | |
| SkiLa2025.12 | 66.5 | — | — | |
| LVR 7B*Model Size=7B, Tested by authors=true2025.12 | 66.1 | — | — | |
| SkiLa-V2025.12 | 65.2 | — | — | |
| Qwen2.5-VL 7BModel Size=7B2025.12 | 65 | — | — | |
| Base (M_def^(0))2026.01 | 64.88 | 51 | 78.75 | |
| Direct SFT2025.12 | 61 | — | — | |
| LLaVA-OneVision 7BModel Size=7B2025.12 | 59.8 | — | — | |
| Vision-R1 7B*Model Size=7B, Tested by authors=true2025.12 | 57 | — | — | |
| GPT-4o2025.12 | 55.5 | — | — |