Element Grounding on Multimodal-Mind2Web
49.1Element AccuracyUGround-V1-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| UGround-V1-7BInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 49.1 | |
| UGround-V1-2BInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 48 | |
| UGroundInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 46.8 | |
| UGroundInput=Image (SeeAct-V), Planner=GPT-42024.10 | 44.8 | |
| ChoiceInput=Image + Text, Planner=GPT-42024.10 | 42.3 | |
| SeeClickInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 32.9 | |
| SeeClickInput=Image (SeeAct-V), Planner=GPT-42024.10 | 29.6 | |
| SoMInput=Image + Text, Planner=GPT-42024.10 | 25.6 |