Text-to-Image Generation on GenEval (Core Compositional Metrics)
100Single Object AccuracyLumina-mGPT-768
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Lumina-mGPT-768Budget Ratio (rho)=Full, Visual Tokens (N)=2352, Throughput=0.04it/s, Speedup=1.00x2025.12 | 100 | 73 | 25 | 82 | 52 | |
| LineAR (Janus-Pro-1B)Budget Ratio (rho)=1/4, Visual Tokens (N)=576, Throughput=4.03it/s, Speedup=4.53x2025.12 | 99 | 86 | 49 | 89 | 72 | |
| LineAR (Janus-Pro-1B)Budget Ratio (rho)=1/6, Visual Tokens (N)=576, Throughput=5.22it/s, Speedup=5.87x2025.12 | 99 | 81 | 51 | 89 | 71 | |
| Janus-Pro-7BBudget Ratio (rho)=Full, Visual Tokens (N)=576, Throughput=0.35it/s, Speedup=1.00x2025.12 | 99 | 86 | 57 | 91 | 79 | |
| LineAR (Janus-Pro-7B)Budget Ratio (rho)=1/4, Visual Tokens (N)=576, Throughput=1.58it/s, Speedup=4.49x2025.12 | 99 | 89 | 58 | 93 | 80 | |
| LineAR (Janus-Pro-7B)Budget Ratio (rho)=1/6, Visual Tokens (N)=576, Throughput=1.98it/s, Speedup=5.62x2025.12 | 99 | 88 | 52 | 91 | 78 | |
| LineAR (Lumina-mGPT-768)Budget Ratio (rho)=1/6, Visual Tokens (N)=2352, Throughput=0.08it/s, Speedup=1.93x2025.12 | 99 | 74 | 28 | 84 | 52 | |
| LineAR (Lumina-mGPT-768)Budget Ratio (rho)=1/8, Visual Tokens (N)=2352, Throughput=0.09it/s, Speedup=2.13x2025.12 | 99 | 73 | 24 | 86 | 52 | |
| LineAR (Lumina-mGPT-1024)Budget Ratio (rho)=1/8, Visual Tokens (N)=4160, Throughput=0.07it/s, Speedup=2.64x2025.12 | 99 | 75 | 30 | 82 | 55 | |
| Janus-Pro-1BBudget Ratio (rho)=Full, Visual Tokens (N)=576, Throughput=0.89it/s, Speedup=1.00x2025.12 | 98 | 83 | 50 | 90 | 73 | |
| Lumina-mGPT-1024Budget Ratio (rho)=Full, Visual Tokens (N)=4160, Throughput=0.01it/s, Speedup=1.00x2025.12 | 98 | 76 | 29 | 83 | 56 |