Subject-driven Video Generation Efficiency
10Training StepsCustomCrafter
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CustomCrafterZero-shot=✗, Required Inputs=200 regularizing imgs per subject, Base Model (Param.)=VideoCrafter2 [9] (1.4B)2025.04 | 10 | 200 | |
| PhantomZero-shot=✓, Dataset Size=1M subject-video pairs, Base Model (Param.)=Wan [49] (1.3–14B) + Seed [50]2025.04 | 30 | 10 | |
| VACEZero-shot=✓, Dataset Size=53M source videos, Base Model (Param.)=LTX [18] & Wan [49] (1.3–14B)2025.04 | 200 | 70 | |
| VideoBoothZero-shot=△, Dataset Size=48,724 subject-video pairs, Base Model (Param.)=SD-based VDM [20, 42] (1.08B)2025.04 | 400 | 775 | |
| Still-MovingZero-shot=✗, Required Inputs=Few reference images + 40 videos, Base Model (Param.)=Lumiere [3] (1.2B)2025.04 | 500 | — | |
| Ours-tiny/miniZero-shot=✓, Dataset Size=2,000/4,000 subject-image pairs + 4,000 arbitrary videos, Base Model (Param.)=CogVideoX [56] (5B)2025.04 | 4,000 | 288 | |
| OursZero-shot=✓, Dataset Size=200K subject-image pairs + 4,000 arbitrary videos, Base Model (Param.)=CogVideoX [56] (5B) & Wan [49] (2.2-5B)2025.04 | 4,000 | 288 |