GUI Visual Question Answering and Grounding on MMBench-GUI L2
80.4AccuracyGROUNDNEXT-7B (SFT)
Evaluation Results
| Method | Links | |
|---|---|---|
| GROUNDNEXT-7B (SFT)Model Scale=7B, Training Paradigm=SFT2025.11 | 80.4 | |
| GROUNDNEXT-3B (SFT)Model Scale=3B, Training Paradigm=SFT2025.11 | 75.5 | |
| GUI-Actor-7BModel Scale=7B, Training Paradigm=SFT2025.11 | 70.9 | |
| JEDI-7BModel Scale=7B, Training Paradigm=SFT2025.11 | 70.4 | |
| GUI-Actor-3BModel Scale=3B, Training Paradigm=SFT2025.11 | 69.8 | |
| Qwen2.5-VL-7B (Agent mode)Model Scale=7B, Evaluation Mode=Agent mode, Training Paradigm=SFT2025.11 | 67.7 | |
| JEDI-3BModel Scale=3B, Training Paradigm=SFT2025.11 | 66.5 | |
| UGround-V1-7BModel Scale=7B, Training Paradigm=SFT2025.11 | 65.7 | |
| Qwen2.5-VL-3BModel Scale=3B, Training Paradigm=SFT2025.11 | 60.8 | |
| Qwen2.5-VL-3B (Agent mode)Model Scale=3B, Evaluation Mode=Agent mode, Training Paradigm=SFT2025.11 | 60.8 | |
| PhiGround-4B-7CModel Scale=4B, Training Paradigm=SFT2025.11 | 60.3 | |
| Aguvis-7BModel Scale=7B, Training Paradigm=SFT2025.11 | 45.7 | |
| OS-Atlas-7BModel Scale=7B, Training Paradigm=SFT2025.11 | 41.4 | |
| Qwen2.5-VL-7BModel Scale=7B, Training Paradigm=SFT2025.11 | 33.9 |