Text-to-Video on MS-COCO random 1,000 prompts 2017 (test)
0.3918Textual FaithfulnessCogVideoX 2B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CogVideoX 2BSampler=Original, Steps=402025.03 | 0.3918 | 95.14 | — | |
| LTC-AccelBase Model=CogVideoX 2B, Steps=262025.03 | 0.3775 | 95.11 | 1.54 | |
| Animated-DiffSampler=Original, Steps=302025.03 | 0.3662 | 96.76 | — | |
| LTC-AccelBase Model=Animated-Diff, Steps=192025.03 | 0.3465 | 96.81 | 1.58 | |
| Animated-DiffSampler=Original, Steps=202025.03 | 0.305 | 97.29 | — | |
| LTC-AccelBase Model=Animated-Diff, Steps=132025.03 | 0.2939 | 97.32 | 1.54 | |
| Animated-DiffSampler=Original, Steps=102025.03 | 0.2439 | 97.13 | — | |
| LTC-AccelBase Model=Animated-Diff, Steps=72025.03 | 0.2426 | 97 | 1.43 | |
| LTC-AccelBase Model=CogVideoX 2B, Steps=192025.03 | 0.232 | 94.35 | 1.58 | |
| CogVideoX 2BSampler=Original, Steps=302025.03 | 0.2302 | 94.64 | — | |
| CogVideoX 2B (int8)Sampler=Original, Steps=40, Precision=int82025.03 | 0.2113 | 94.56 | — | |
| LTC-AccelBase Model=CogVideoX 2B, Steps=26, Precision=int82025.03 | 0.201 | 94.49 | 1.54 | |
| CogVideoX 2BSampler=Original, Steps=202025.03 | -0.1441 | 94.42 | — | |
| LTC-AccelBase Model=CogVideoX 2B, Steps=142025.03 | -0.1673 | 93.61 | 1.43 |