Element Grounding on Multimodal-Mind2Web Cross-Task
50.7Element AccuracyUGround-V1-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| UGround-V1-7BInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 50.7 | |
| UGround-V1-2BInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 48.6 | |
| UGround-V1-7BInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 48.5 | |
| UGroundInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 47.7 | |
| UGround-V1-2BInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 47.7 | |
| UGroundInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 46.6 | |
| ChoiceInput=Image + Text, Planner=GPT-42024.10 | 46.4 | |
| UGroundInput=Image (SeeAct-V), Planner=GPT-42024.10 | 45.1 | |
| UGroundInput=Image (SeeAct-V), Planner=GPT-42024.10 | 44.6 | |
| ChoiceInput=Image + Text, Planner=GPT-42024.10 | 42.4 | |
| SeeClickInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 33.5 | |
| SeeClickInput=Image (SeeAct-V), Planner=GPT-4o2024.10 | 32.1 | |
| SeeClickInput=Image (SeeAct-V), Planner=GPT-42024.10 | 30.7 | |
| SeeClickInput=Image (SeeAct-V), Planner=GPT-42024.10 | 29.7 | |
| SoMInput=Image + Text, Planner=GPT-42024.10 | 29.6 | |
| SoMInput=Image + Text, Planner=GPT-42024.10 | 27 |