Image Reconstruction on ImageNet 256x256 (evaluation set)
0.34rFIDSSDD-L
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| SSDD-Lf (downsampling factor)=16, c (latent channels)=16, #D (decoder parameters)=85.2M, N (decoding steps)=12025.10 | 0.34 | 315 | 0.053 | 0.03 | 24.2 | 0.74 | |
| SSDD-XLf (downsampling factor)=8, c (latent channels)=4, #D (decoder parameters)=153.8M, N (decoding steps)=12025.10 | 0.35 | 215 | 0.052 | 0.031 | 24.6 | 0.76 | |
| SSDD-Lf (downsampling factor)=8, c (latent channels)=4, #D (decoder parameters)=85.2M, N (decoding steps)=12025.10 | 0.36 | 302 | 0.053 | 0.032 | 24.49 | 0.76 | |
| SSDD-XLf (downsampling factor)=16, c (latent channels)=16, #D (decoder parameters)=153.8M, N (decoding steps)=12025.10 | 0.36 | 213 | 0.052 | 0.03 | 24.31 | 0.75 | |
| ε-VAE (H)f (downsampling factor)=8, c (latent channels)=4, #D (decoder parameters)=355.6M, N (decoding steps)=32025.10 | 0.38 | 33 | — | — | 29.49 | 0.85 | |
| SSDD-Mf (downsampling factor)=8, c (latent channels)=4, #D (decoder parameters)=48.0M, N (decoding steps)=12025.10 | 0.39 | 357 | 0.055 | 0.034 | 24.38 | 0.75 | |
| SSDD-Mf (downsampling factor)=16, c (latent channels)=16, #D (decoder parameters)=48.0M, N (decoding steps)=12025.10 | 0.4 | 368 | 0.056 | 0.033 | 24.08 | 0.74 | |
| SSDD-Bf (downsampling factor)=16, c (latent channels)=16, #D (decoder parameters)=20.2M, N (decoding steps)=12025.10 | 0.41 | 686 | 0.059 | 0.035 | 23.86 | 0.73 | |
| SSDD-Bf (downsampling factor)=8, c (latent channels)=4, #D (decoder parameters)=20.2M, N (decoding steps)=12025.10 | 0.42 | 689 | 0.058 | 0.036 | 24.18 | 0.75 | |
| SSDD-Sf (downsampling factor)=16, c (latent channels)=16, #D (decoder parameters)=13.4M, N (decoding steps)=12025.10 | 0.45 | 985 | 0.061 | 0.038 | 23.75 | 0.73 | |
| SSDD-Sf (downsampling factor)=8, c (latent channels)=4, #D (decoder parameters)=13.4M, N (decoding steps)=12025.10 | 0.46 | 1,027 | 0.06 | 0.039 | 24.08 | 0.74 | |
| ε-VAE (M)f (downsampling factor)=8, c (latent channels)=4, #D (decoder parameters)=49.3M, N (decoding steps)=32025.10 | 0.47 | 134 | — | — | 27.65 | 0.84 | |
| VA-VAEf (downsampling factor)=16, c (latent channels)=16, #D (decoder parameters)=39.5M, N (decoding steps)=12025.10 | 0.55 | 1,178 | 0.132 | — | 26.1 | 0.72 | |
| ε-VAE (B, 1-step)f (downsampling factor)=8, c (latent channels)=4, #D (decoder parameters)=20.6M, N (decoding steps)=12025.10 | 0.57 | 526 | — | — | — | — | |
| FlowMo (continuous)f (downsampling factor)=16, c (latent channels)=16, N (decoding steps)=252025.10 | 0.65 | — | 0.054 | — | 26.61 | 0.791 | |
| SD-VAEf (downsampling factor)=8, c (latent channels)=4, #D (decoder parameters)=47.2M, N (decoding steps)=12025.10 | 0.69 | 707 | 0.061 | 0.042 | 25.52 | 0.78 | |
| Consistency decoderf (downsampling factor)=8, c (latent channels)=4, #D (decoder parameters)=625.1M, N (decoding steps)=22025.10 | 0.8 | 23 | 0.065 | 0.044 | 23.71 | 0.73 | |
| KL-VAEf (downsampling factor)=16, c (latent channels)=16, #D (decoder parameters)=36.4M, N (decoding steps)=12025.10 | 0.82 | 1,196 | 0.066 | 0.048 | 23.88 | 0.74 | |
| KL-VAEf (downsampling factor)=8, c (latent channels)=4, #D (decoder parameters)=47.2M, N (decoding steps)=12025.10 | 0.87 | 705 | 0.065 | 0.046 | 24.11 | 0.75 | |
| LiteVAEf (downsampling factor)=8, c (latent channels)=4, #D (decoder parameters)=53.3M, N (decoding steps)=12025.10 | 0.87 | 707 | — | — | 26.02 | 0.74 | |
| SSDD-XLf (downsampling factor)=16, c (latent channels)=4, #D (decoder parameters)=153.8M, N (decoding steps)=12025.10 | 0.89 | 216 | 0.148 | 0.083 | 17.72 | 0.51 | |
| SSDD-Lf (downsampling factor)=16, c (latent channels)=4, #D (decoder parameters)=85.2M, N (decoding steps)=12025.10 | 0.96 | 305 | 0.155 | 0.089 | 17.26 | 0.5 | |
| DiTo-XL-LPIPSf (downsampling factor)=8, c (latent channels)=4, #D (decoder parameters)=592.2M, N (decoding steps)=502025.10 | 1.06 | 1 | 0.077 | 0.055 | 23.53 | 0.72 | |
| SSDD-Mf (downsampling factor)=16, c (latent channels)=4, #D (decoder parameters)=48.0M, N (decoding steps)=12025.10 | 1.23 | 360 | 0.161 | 0.096 | 17.13 | 0.49 | |
| ε-VAE (H)f (downsampling factor)=16, c (latent channels)=4, #D (decoder parameters)=355.6M, N (decoding steps)=32025.10 | 1.35 | 33 | — | — | 22.6 | 0.71 | |
| SSDD-Bf (downsampling factor)=16, c (latent channels)=4, #D (decoder parameters)=20.2M, N (decoding steps)=12025.10 | 1.77 | 663 | 0.177 | 0.111 | 16.06 | 0.46 | |
| ε-VAE (M)f (downsampling factor)=16, c (latent channels)=4, #D (decoder parameters)=49.3M, N (decoding steps)=32025.10 | 1.91 | 134 | — | — | 21.27 | 0.69 | |
| SSDD-Sf (downsampling factor)=16, c (latent channels)=4, #D (decoder parameters)=13.4M, N (decoding steps)=12025.10 | 2.29 | 951 | 0.186 | 0.121 | 15.59 | 0.45 | |
| KL-VAEf (downsampling factor)=16, c (latent channels)=4, #D (decoder parameters)=36.4M, N (decoding steps)=12025.10 | 2.93 | 1,176 | — | — | 20.57 | 0.66 |