Multimodal Agent Evaluation on VisualWebArena
0.76Pearson rADARUBRIC-DA (visual)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ADARUBRIC-DA (visual)Modality=visual, Fine-tuning Base Model=Llama-3.1-8B-Instruct2026.03 | 0.76 | 26.3 | |
| ADARUBRIC-WM (visual)Modality=visual, Fine-tuning Base Model=Llama-3.1-8B-Instruct2026.03 | 0.73 | 24.2 | |
| ADARUBRIC-WM (text)Modality=text, Fine-tuning Base Model=Llama-3.1-8B-Instruct2026.03 | 0.69 | 22.7 | |
| GPT-4V Direct2026.03 | 0.62 | 20.5 | |
| Prometheus2026.03 | 0.57 | 19.1 | |
| G-Eval (text only)Modality=text only2026.03 | 0.48 | 17.3 |