Text-to-Video Generation on Inseval (test)
0.64Single ActionCogVideoX-5B
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| CogVideoX-5BBase T2V Model=CogVideoX-5B2024.12 | 0.64 | 0.6 | 0.44 | 0.6 | 0.2 | 0.08 | 0.48 | 0.4 | 0.43 | |
| Open-Sora Plan v1.3-2.7BBase T2V Model=Open-Sora Plan v1.3-2.7B2024.12 | 0.64 | 0.44 | 0.36 | 0.32 | 0.27 | 0.2 | 0.32 | 0.12 | 0.3338 | |
| InstanceCapBase T2V Model=Open-Sora v1.2-1.1B, Captioning Method=InstanceCap2024.12 | 0.56 | 0.6 | 0.4 | 0.48 | 0.27 | 0.16 | 0.32 | 0.24 | 0.3788 | |
| LLaVABase T2V Model=Open-Sora v1.2-1.1B, Captioning Method=LLaVA2024.12 | 0.52 | 0.52 | 0.28 | 0.28 | 0.2 | 0.12 | 0.28 | 0.16 | 0.295 | |
| Pyramid-Flow-2BBase T2V Model=Pyramid-Flow-2B2024.12 | 0.44 | 0.68 | 0.32 | 0.32 | 0.07 | 0.04 | 0.24 | 0.16 | 0.2838 | |
| Open-Sora v1.2-1.1BBase T2V Model=Open-Sora v1.2-1.1B2024.12 | 0.4 | 0.56 | 0.36 | 0.4 | 0.13 | 0.12 | 0.16 | 0.16 | 0.2863 | |
| Panda-captionerBase T2V Model=Open-Sora v1.2-1.1B, Captioning Method=Panda-captioner2024.12 | 0.4 | 0.48 | 0.28 | 0.4 | 0.2 | 0.08 | 0.2 | 0.12 | 0.27 | |
| ShareGPT4VideoBase T2V Model=Open-Sora v1.2-1.1B, Captioning Method=ShareGPT4Video2024.12 | 0.4 | 0.44 | 0.32 | 0.24 | 0.13 | 0.16 | 0.08 | 0.2 | 0.2463 |