Pixel Forecasting on Frozen Forecasting Unified Evaluation
22.48Mean Pixel PSNRN-WALT 500M
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| N-WALT 500MParams=500M, Diffusion Model Samples=10, Context Frames=42025.07 | 22.48 | 0.19 | 22.78 | 28.95 | |
| 4DS-hType=V/M, Variant=h, Resolution=224, Params=639M, Training Time=488,282 steps, Diffusion Model Samples=10, Context Frames=42025.07 | 20.54 | 1.4 | 22.69 | 31.24 | |
| WALT 500MParams=500M, Diffusion Model Samples=10, Context Frames=42025.07 | 20.4 | 1.37 | 22.55 | 28.95 | |
| VideoMAEType=V/M, Variant=H, Resolution=224, Params=600M, Training Time=1600 epochs, Diffusion Model Samples=10, Context Frames=42025.07 | 20.23 | 1.1834 | 22.13 | 28.54 | |
| 4DS-eType=V/M, Variant=e, Resolution=224, Params=4B, Training Time=488,282 steps, Diffusion Model Samples=10, Context Frames=42025.07 | 19.89 | 1.42 | 22.03 | 32.26 | |
| VJEPAType=V/M, Variant=L, Resolution=224, Params=300M, Training Time=90k steps, Diffusion Model Samples=10, Context Frames=42025.07 | 19.51 | 1.14 | 21.26 | 24.41 | |
| VideoMAEv2Type=V/M, Variant=g, Resolution=224, Params=1B, Training Time=1200 epochs, Diffusion Model Samples=10, Context Frames=42025.07 | 18.59 | 1.41 | 20.81 | 26.44 | |
| VideoPrismType=V/M/L, Variant=v_giant, Resolution=288, Params=1.1B, Training Time=500k steps, Diffusion Model Samples=10, Context Frames=42025.07 | 17.63 | 1.03 | 19.32 | 23.33 | |
| DINOv2Type=I, Variant=DINOV2_L/14, Resolution=224, Params=303M, Training Time=637.5k steps, Diffusion Model Samples=10, Context Frames=42025.07 | 16.38 | 0.857 | 17.78 | 19.97 | |
| SigLIPType=I/L, Variant=PaLI3-SigLIP-G-opt/14, Resolution=224, Params=2B, Training Time=107k steps, Diffusion Model Samples=10, Context Frames=42025.07 | 13.64 | 0.39 | 14.29 | 16.48 |