Text-to-Video Generation Inference on T2V Models HunyuanVideo, Wan2.2
199Latency (ms)RoME
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RoMEModel=Wan2.2, Parameters=1.3B, QKShape[BNSD]=[1, 12, 6630, 128]/272P2026.04 | 199 | 3.9 | |
| RoPEModel=Wan2.2, Parameters=1.3B, QKShape[BNSD]=[1, 12, 6630, 128]/272P2026.04 | 209 | — | |
| RoMEModel=Wan2.2, Parameters=1.3B, QKShape[BNSD]=[1, 12, 17550, 128]/480P2026.04 | 759 | 3.4 | |
| RoPEModel=Wan2.2, Parameters=1.3B, QKShape[BNSD]=[1, 12, 17550, 128]/480P2026.04 | 790 | — | |
| RoMEModel=Wan2.2, Parameters=14B, QKShape[BNSD]=[1, 40, 6630, 128]/272P2026.04 | 1,120 | 4.3 | |
| RoPEModel=Wan2.2, Parameters=14B, QKShape[BNSD]=[1, 40, 6630, 128]/272P2026.04 | 1,170 | — | |
| RoMEModel=Wan2.2, Parameters=14B, QKShape[BNSD]=[1, 40, 17550, 128]/480P2026.04 | 4,350 | 3.3 | |
| RoPEModel=Wan2.2, Parameters=14B, QKShape[BNSD]=[1, 40, 17550, 128]/480P2026.04 | 4,500 | — | |
| RoMEModel=HunyuanVideo, Parameters=13B, QKShape[BNSD]=[1, 24, 42840, 128]/540P2026.04 | 14,400 | 0.1 | |
| RoPEModel=HunyuanVideo, Parameters=13B, QKShape[BNSD]=[1, 24, 42840, 128]/540P2026.04 | 14,410 | — | |
| RoMEModel=HunyuanVideo, Parameters=13B, QKShape[BNSD]=[1, 24, 8192, 128]/720P2026.04 | 40,100 | 0.1 | |
| RoPEModel=HunyuanVideo, Parameters=13B, QKShape[BNSD]=[1, 24, 8192, 128]/720P2026.04 | 40,120 | — |