Goal-conditioned visual planning on COIN T=3 71 (test)
45.29SRGeoWorld ViT-g384
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GeoWorld ViT-g384Model Category=Predictive (World) Models, Backbone=ViT-g3842026.02 | 45.29 | 65.52 | 93.91 | |
| GPT-5Model Category=LLM-Based2026.02 | 43.84 | 64.67 | 91.12 | |
| GeoWorld ViT-gModel Category=Predictive (World) Models, Backbone=ViT-g2026.02 | 42.84 | 62.63 | 93.69 | |
| V-JEPA 2 ViT-g384Model Category=Predictive (World) Models, Backbone=ViT-g3842026.02 | 42.74 | 64.08 | 91.88 | |
| Gemini 2.5 ProModel Category=LLM-Based2026.02 | 42.07 | 61.02 | 92.94 | |
| V-JEPA 2 ViT-gModel Category=Predictive (World) Models, Backbone=ViT-g2026.02 | 40.97 | 61.86 | 90.77 | |
| GeoWorld ViT-HModel Category=Predictive (World) Models, Backbone=ViT-H2026.02 | 40.4 | 60.97 | 91.66 | |
| V-JEPA 2 ViT-HModel Category=Predictive (World) Models, Backbone=ViT-H2026.02 | 39.42 | 59.42 | 89.44 | |
| GeoWorld ViT-LModel Category=Predictive (World) Models, Backbone=ViT-L2026.02 | 37.76 | 58.14 | 88 | |
| Qwen3-VL-MaxModel Category=LLM-Based2026.02 | 37.56 | 57.8 | 90.46 | |
| InternVL3.5-241BModel Category=LLM-Based2026.02 | 36.54 | 57.22 | 89.02 | |
| V-JEPA 2 ViT-LModel Category=Predictive (World) Models, Backbone=ViT-L2026.02 | 36.1 | 56.7 | 87.02 | |
| VideoWorldModel Category=Generative (World) Models2026.02 | 34.88 | 54.71 | 85.58 |