Multi-shot Audio-Visual Generation on MAVINSet high-fidelity benchmark 1K-sample (test)
231.6FVDMAVIN
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| MAVINGeneration Paradigm=Joint Generation Models, Pipeline=T2AV, Role Reference Setting=None2026.06 | 231.6 | 6.8 | 0.2471 | 0.2392 | 0.048 | 6.032 | 0.263 | 0.8104 | 0.9695 | 0.9657 | 0.6319 | 0.8013 | 0.9897 | |
| CineTransGeneration Paradigm=Cascaded Generation Models, Pipeline=Multi-shot T2V + V2A, Role Reference Setting=None2026.06 | 254.2 | 11.9 | 0.2013 | 0.2098 | — | 1.892 | 0.201 | — | 0.9425 | 0.9543 | 0.6073 | 0.7603 | 0.582 | |
| IC-LoRA + WanGeneration Paradigm=Cascaded Generation Models, Pipeline=Multi-shot T2V + V2A, Role Reference Setting=None2026.06 | 268.5 | 12.7 | 0.2193 | 0.2012 | — | 2.103 | 0.192 | — | 0.9512 | 0.9626 | 0.5286 | 0.7519 | — | |
| EchoShotGeneration Paradigm=Cascaded Generation Models, Pipeline=Multi-shot T2V + V2A, Role Reference Setting=None2026.06 | 276.3 | 12.3 | 0.2072 | 0.2191 | — | 2.095 | 0.207 | — | 0.9532 | 0.9572 | 0.6104 | 0.7599 | 0.6002 | |
| LTX-2Generation Paradigm=Joint Generation Models, Pipeline=T2AV, Role Reference Setting=None2026.06 | 289.7 | 8.6 | 0.2001 | 0.2287 | 0.097 | 4.365 | 0.203 | 0.5343 | 0.9593 | 0.9553 | 0.6015 | 0.7812 | 0.5733 | |
| StoryDiff. + WanGeneration Paradigm=Cascaded Generation Models, Pipeline=Multi-shot T2V + V2A, Role Reference Setting=None2026.06 | 304.6 | 13.3 | 0.2124 | 0.1978 | — | 2.013 | 0.191 | — | 0.9487 | 0.9654 | 0.5613 | 0.7993 | — | |
| OVIGeneration Paradigm=Joint Generation Models, Pipeline=T2AV, Role Reference Setting=None2026.06 | 318.4 | 8.3 | 0.1983 | 0.2203 | 0.093 | 4.231 | 0.227 | 0.4432 | 0.9565 | 0.9578 | 0.6121 | 0.7789 | 0.4992 | |
| UniVerse-1Generation Paradigm=Joint Generation Models, Pipeline=T2AV, Role Reference Setting=None2026.06 | 356.9 | 11.2 | 0.182 | 0.172 | 0.199 | 3.851 | 0.193 | 0.2892 | 0.9499 | 0.9601 | — | — | — | |
| MovieAgentGeneration Paradigm=Cascaded Generation Models, Pipeline=Multi-shot T2V + V2A, Role Reference Setting=None2026.06 | 395.3 | 15.9 | 0.1271 | 0.1995 | — | 1.913 | 0.179 | — | 0.9656 | 0.9298 | 0.4872 | 0.6744 | — | |
| VideoGen-of-ThoughtGeneration Paradigm=Cascaded Generation Models, Pipeline=Multi-shot T2V + V2A, Role Reference Setting=None2026.06 | 418.7 | 13.2 | 0.1537 | 0.1939 | — | 2.278 | 0.184 | — | 0.9593 | 0.9578 | 0.6195 | 0.7802 | — | |
| JavisDiTGeneration Paradigm=Joint Generation Models, Pipeline=T2AV, Role Reference Setting=None2026.06 | 512.6 | 21.3 | 0.163 | 0.1937 | 0.305 | 3.734 | 0.239 | 0.1012 | 0.9512 | 0.9567 | — | — | — |