Element Grounding on Multimodal-Mind2Web Cross-Website
48.1Element AccuracyUGround-V1-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| UGround-V1-7BInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 48.1 | |
| UGround-V1-2BInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 47.6 | |
| UGroundInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 46 | |
| UGroundInput=Image (SeeAct-V), Planner=GPT-42024.10 | 44.7 | |
| ChoiceInput=Image + Text, Planner=GPT-42024.10 | 38 | |
| SeeClickInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 33.1 | |
| SeeClickInput=Image (SeeAct-V), Planner=GPT-42024.10 | 28.5 | |
| SoMInput=Image + Text, Planner=GPT-42024.10 | 20.1 |