Text-conditioned video prediction on Something-Something V2
112.9FVDSeer
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SeerPre.-weight=txt-img, Text=Yes, Resolution=256 × 2562023.03 | 112.9 | 0.12 | |
| VideoFusionPre.-weight=txt-video, Text=Yes, Resolution=256 × 2562023.03 | 163.2 | 0.2 | |
| Tune-A-VideoPre.-weight=txt-img, Text=Yes, Resolution=256 × 2562023.03 | 291.4 | 0.91 | |
| TATSPre.-weight=video, Text=No, Resolution=128 × 1282023.03 | 428.1 | 2,177 | |
| PVDMPre.-weight=No, Text=No, Resolution=256 × 2562023.03 | 502.4 | 61.08 | |
| SimVPPre.-weight=No, Text=No, Resolution=64 × 642023.03 | 537.2 | 0.61 | |
| MAGEPre.-weight=video, Text=Yes, Resolution=128 × 1282023.03 | 1,201.8 | 1.64 | |
| MCVDPre.-weight=No, Text=No, Resolution=256 × 2562023.03 | 1,407 | 3.8 |