Long-form Text-to-Video Generation on Prompt-pair storytelling dataset
0.3055CLIP Score (Additive)Ours (Full Model)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Ours (Full Model)Backbone=Mochi-1, Resolution=848x480, CFG scale=4.5, Denoising steps=64, DIPW=true, TWB=true, SAR=true2025.03 | 0.3055 | 0.3211 | 29.5117 | 0.9697 | 0.6733 | |
| Ours w/o TWBBackbone=Mochi-1, Resolution=848x480, CFG scale=4.5, Denoising steps=64, DIPW=true, TWB=false, SAR=true2025.03 | 0.2944 | 0.303 | 29.1403 | 0.9655 | 0.6803 | |
| MochiBackbone=Mochi-1, Resolution=848x480, CFG scale=4.5, Denoising steps=642025.03 | 0.294 | 0.3103 | 29.5948 | 0.953 | 0.6811 | |
| Ours w/o SARBackbone=Mochi-1, Resolution=848x480, CFG scale=4.5, Denoising steps=64, DIPW=true, TWB=true, SAR=false2025.03 | 0.2926 | 0.3005 | 28.7187 | 0.9526 | 0.6396 | |
| VloggerBackbone=Mochi-1, Resolution=848x480, CFG scale=4.5, Denoising steps=642025.03 | 0.2889 | 0.2998 | 28.8509 | 0.9254 | 0.6193 | |
| Ours w/o DIPWBackbone=Mochi-1, Resolution=848x480, CFG scale=4.5, Denoising steps=64, DIPW=false, TWB=true, SAR=true2025.03 | 0.2883 | 0.3013 | 28.945 | 0.9418 | 0.6412 |