Long-Context Video Prediction on DMLab 64x64
48FVDTECO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| TECOParams=169 M, c (context frames)=144, p (predicted frames)=1562025.03 | 48 | 0.703 | 21.9 | 0.157 | |
| TECOParams=169 M, c (context frames)=36, p (predicted frames)=2642025.03 | 51 | — | — | — | |
| FAR-B-LongParams=150 M, c (context frames)=36, p (predicted frames)=2642025.03 | 54 | — | — | — | |
| FAR-B-LongParams=150 M, c (context frames)=144, p (predicted frames)=1562025.03 | 64 | 0.687 | 22.3 | 0.104 | |
| Perceiver ARParams=30 M, c (context frames)=144, p (predicted frames)=1562025.03 | 96 | 0.304 | 11.2 | 0.487 | |
| Perceiver ARParams=30 M, c (context frames)=36, p (predicted frames)=2642025.03 | 111 | — | — | — | |
| FitVidParams=165 M, c (context frames)=36, p (predicted frames)=2642025.03 | 123 | — | — | — | |
| CW-VAEParams=111 M, c (context frames)=144, p (predicted frames)=1562025.03 | 125 | 0.372 | 12.6 | 0.465 | |
| CW-VAEParams=111 M, c (context frames)=36, p (predicted frames)=2642025.03 | 133 | — | — | — | |
| Latent FDMParams=31 M, c (context frames)=36, p (predicted frames)=2642025.03 | 148 | — | — | — | |
| FitVidParams=165 M, c (context frames)=144, p (predicted frames)=1562025.03 | 176 | 0.356 | 12 | 0.491 | |
| Latent FDMParams=31 M, c (context frames)=144, p (predicted frames)=1562025.03 | 181 | 0.588 | 17.8 | 0.222 |