Text-to-Video Generation on VBench (Quality, Frame, and Alignment Metrics)
78.49VBench Quality ScoreVChain (Ours)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VChain (Ours)Framework=Full framework with Visual Thought Reasoning and Sparse Inference-Time Visual-State Adaptation2025.10 | 78.49 | 71.67 | 65.82 | 67.77 | |
| Without Visual ThoughtAblation=Text-only thoughts, omitting visual thoughts for sparse tuning2025.10 | 78.47 | 64.26 | 52.93 | 54.69 | |
| T2V + Prompt AugEnhancement=GPT-based prompt augmentation2025.10 | 77.51 | 55.47 | 50.59 | 47.66 | |
| T2VModification=Original pre-trained model without modification2025.10 | 76.21 | 57.24 | 43.65 | 40.04 | |
| Without Sparse TuningAblation=GPT-generated keyframes as-is, without fine-tuning2025.10 | 73.35 | 44.07 | 29.19 | 42.97 |