Text-to-Video Generation on WebVid 400 samples (val)
0.308CLIP ScoreAnimateDiff
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| AnimateDiffRetrained=true, Training Subset Size=100K videos, Frames (T)=8, Resolution=256x256, Noise correlation (ρ)=0.6, Temporal loss (λtemp)=02026.03 | 0.308 | 0.969 | 0.062 | 81.63 | 79.61 | |
| Motion-Adaptive Temporal UNetBase Model=SD 2.1, Training Subset Size=100K videos, Frames (T)=8, Resolution=256x256, Noise correlation (ρ)=0.6, Temporal loss (λtemp)=02026.03 | 0.303 | 0.983 | 0.04 | 92.09 | 92.49 | |
| Motion-Adaptive Temporal UNetBase Model=SD 1.5, Training Subset Size=100K videos, Frames (T)=8, Resolution=256x256, Noise correlation (ρ)=0.6, Temporal loss (λtemp)=02026.03 | 0.302 | 0.98 | 0.051 | 89.96 | 85.99 | |
| SD 1.5Temporal Modules=none, Frames (T)=8, Resolution=256x256, Noise correlation (ρ)=0.6, Temporal loss (λtemp)=02026.03 | 0.267 | 0.777 | 0.326 | 180.48 | 211.02 |