Image-to-Video Generation on VBench I2V (test)
97.88Subject ConsistencySAM2VideoX
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SAM2VideoXbase_model=CogVideoX2025.12 | 97.88 | — | 98.45 | — | — | 95.51 | 96.03 | 360.57 | — | — | — | |
| Track4GenResolution=320x576, Refiner module=included2024.12 | 97.46 | 98.06 | 99.21 | 68.35 | 98.14 | — | — | — | — | — | — | |
| CogVideoX + LoRA Fine-tuningtraining=LoRA Fine-tuning2025.12 | 97.44 | — | 97.76 | — | — | 94.02 | 94.74 | 465 | — | — | — | |
| CogVideoX + REPAalignment=REPA2025.12 | 97.41 | — | 97.31 | — | — | 92.91 | 93.77 | 457.59 | — | — | — | |
| CogVideoXmode=base model2025.12 | 97.3 | — | 98.17 | — | — | 94.8 | 95.5 | 660.29 | — | — | — | |
| HunyuanVidmode=base model2025.12 | 96.85 | — | 98.76 | — | — | 95.62 | 96.24 | 583.99 | — | — | — | |
| finetuned SVDResolution=320x576, Fine-tuned=true2024.12 | 96.65 | 98 | 99.09 | 67.66 | 97.71 | — | — | — | — | — | — | |
| SVD* (576p)Resolution=576x1024, Pre-trained=true2024.12 | 95.76 | 94.78 | 97.95 | 68.12 | 95.82 | — | — | — | — | — | — | |
| SVD*Resolution=320x576, Pre-trained=true2024.12 | 95.35 | 94.64 | 97.74 | 66.48 | 95.39 | — | — | — | — | — | — | |
| Track4Gen w/o refinerResolution=320x576, Refiner module=excluded2024.12 | 95.06 | 97.25 | 97.91 | 66.53 | 96.14 | — | — | — | — | — | — | |
| FP16 baselinePrecision=FP162026.06 | 91.99 | — | — | 70.86 | 96.26 | 97.3 | — | — | — | — | 54.45 | |
| Wan2.2 I2V W4A4 inference stackQuantization=W4A4, Recipe=SmoothQuant-style folding, MixQ-style outlier splitting, and block-wise HiF4 packing2026.06 | 88.75 | — | — | 69.36 | 93.75 | 97.69 | — | — | — | — | 52.74 | |
| Native HiFloat4Quantization=W4A4, Precision=HiFloat42026.06 | 87.39 | — | — | 67.32 | 91.45 | 92.43 | — | — | — | — | 51.73 | |
| CogVideoX + Mask Supervisionsupervision=Mask Supervision2025.12 | — | — | — | — | — | — | — | 397.73 | — | — | — | |
| CogVideoX-5BParameters=5B2025.12 | — | — | — | 78.61 | — | — | — | — | 94.79 | 86.7 | — | |
| HunyuanVideo2025.12 | — | — | — | 78.54 | — | — | — | — | 95.1 | 86.82 | — | |
| MetaCanvasBackbone=Wan2.2-5B2025.12 | — | — | — | 76.76 | — | — | — | — | 97.5 | 87.13 | — | |
| Wan2.1-14BParameters=14B2025.12 | — | — | — | 80.82 | — | — | — | — | 92.9 | 86.86 | — | |
| Wan2.2-5BParameters=5B2025.12 | — | — | — | 78.26 | — | — | — | — | 95.69 | 86.98 | — |