GUI world modeling on MobileWorldBench Delta description
4.29AccuracyMobileWorldModel-8B
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MobileWorldModel-8Bvisual hint=true, VLM-as-a-judge=Gemini-3.1-Pro2026.05 | 4.29 | 3.77 | 4.68 | 12.74 | |
| MobileWorldModel-8Bvisual hint=false, VLM-as-a-judge=Gemini-3.1-Pro2026.05 | 4.26 | 3.65 | 4.62 | 12.53 | |
| Mobile-8BVLM-as-a-judge=Gemini-3.1-Pro2026.05 | 4.19 | 3.7 | 4.5 | 12.39 | |
| Claude-4.6-SonnetVLM-as-a-judge=Gemini-3.1-Pro2026.05 | 4.14 | 3.49 | 4.48 | 12.11 | |
| Gemini-3.1-ProVLM-as-a-judge=Gemini-3.1-Pro2026.05 | 3.66 | 2.94 | 4.05 | 10.65 | |
| MobileWorldModel-4Bvisual hint=true, VLM-as-a-judge=Gemini-3.1-Pro2026.05 | 3.64 | 3.39 | 4.04 | — | |
| GPT-5.2VLM-as-a-judge=Gemini-3.1-Pro2026.05 | 3.55 | 3.11 | 3.82 | 10.48 | |
| MobileWorldModel-4Bvisual hint=false, VLM-as-a-judge=Gemini-3.1-Pro2026.05 | 3.55 | 3.34 | 3.99 | 10.87 | |
| Qwen3-VL-32BVLM-as-a-judge=Gemini-3.1-Pro2026.05 | 3.36 | 2.75 | 3.77 | 9.87 | |
| Qwen3-VL-4BVLM-as-a-judge=Gemini-3.1-Pro2026.05 | 3.28 | 2.45 | 3.56 | 9.28 | |
| Qwen3-VL-8BVLM-as-a-judge=Gemini-3.1-Pro2026.05 | 3.24 | 2.44 | 3.56 | 9.25 |