Video Extrapolation on 5 long descriptive prompts (3x / 249f) Wan 2.1 1.3B (train-free extrapolation)
62.5VQevalLVSA (SDPA)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LVSA (SDPA)Backbone=Wan 2.1 1.3B, Attention Backend=SDPA2026.05 | 62.5 | 796 | — | |
| LVSA-FIBackbone=Wan 2.1 1.3B, Attention Backend=FlashInfer2026.05 | 62.3 | 621 | — | |
| UltraViCoBackbone=Wan 2.1 1.3B2026.05 | 60.4 | 1,544 | — | |
| DenseBackbone=Wan 2.1 1.3B2026.05 | 51.1 | 1,145 | — | |
| RIFLExBackbone=Wan 2.1 1.3B2026.05 | 51.1 | 1,149 | — | |
| LVSA-FI speedup vs. DenseBackbone=Wan 2.1 1.3B2026.05 | — | — | 1.84 | |
| LVSA-FI speedup vs. RIFLExBackbone=Wan 2.1 1.3B2026.05 | — | — | 1.85 | |
| LVSA-FI speedup vs. UltraViCoBackbone=Wan 2.1 1.3B2026.05 | — | — | 2.48 |