Text-to-Video Generation on 20 diverse scenarios (test)
58.01Physics Reasoning AccuracyVChain (Ours)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| VChain (Ours)Framework=Full framework with Visual Thought Reasoning and Sparse Inference-Time Visual-State Adaptation2025.10 | 58.01 | 60.16 | 62.12 | |
| Without Visual ThoughtAblation=Text-only thoughts, omitting visual thoughts for sparse tuning2025.10 | 44.14 | 43.75 | 47.51 | |
| T2V + Prompt AugEnhancement=GPT-based prompt augmentation2025.10 | 38.09 | 38.48 | 41.99 | |
| Without Sparse TuningAblation=GPT-generated keyframes as-is, without fine-tuning2025.10 | 33.24 | 34.57 | 34.46 | |
| T2VModification=Original pre-trained model without modification2025.10 | 32.03 | 32.42 | 32.81 |