Video Editing on Video Editing (test)
81.39VBench Qualityw/o Canvas Tokens (Baseline)
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| w/o Canvas Tokens (Baseline)DiT Backbone=Wan2.2-5B, Encoder Type=MLLM as Multimodal Encoder, Canvas Tokens=No2025.12 | 81.39 | 6.61 | 7.25 | 6.68 | — | — | — | |
| DittoDiT Backbone=Wan2.1-14B, Encoder Type=Text Encoder2025.12 | 80.64 | 4.9 | 7.54 | 5.48 | 18.4 | 7.7 | 13.04 | |
| MetaCanvasDiT Backbone=Wan2.2-5B, Encoder Type=MLLM as Multimodal Encoder, Canvas Tokens=Yes2025.12 | 80.27 | 7.91 | 7.5 | 7.56 | 72.1 | 49.6 | 60.84 | |
| InsViEDiT Backbone=CogVideoX-2B, Encoder Type=Text Encoder2025.12 | 79.19 | 3.85 | 4.48 | 3.6 | — | — | — | |
| Lucy-Edit-DevDiT Backbone=Wan2.2-5B, Encoder Type=Text Encoder2025.12 | 78.07 | 5.57 | 7.19 | 5.44 | — | — | — | |
| Lucy-Edit-Dev v1.1DiT Backbone=Wan2.2-5B, Encoder Type=Text Encoder2025.12 | 77.7 | 5.68 | 6.59 | 5.43 | 9.5 | 42.7 | 26.1 |