Multimodal Image-to-Image Translation (Depth+Normal to RGB) on Taskonomy
70.13FIDTokenFusion (S)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TokenFusion (S)Architecture=Transformer-based, Scale=Small, Resolution=256x2562022.04 | 70.13 | 1.92 | |
| TokenFusion (Ti)Architecture=Transformer-based, Scale=Tiny, Resolution=256x2562022.04 | 76.35 | 2.19 | |
| CENArchitecture=CNN-based, Resolution=256x2562022.04 | 84.33 | 2.7 | |
| Concat (S)Architecture=Transformer-based, Scale=Small, Resolution=256x2562022.04 | 96.04 | 4.09 | |
| Self-Att.Architecture=CNN-based, Resolution=256x2562022.04 | 96.73 | 3.95 | |
| ConcatArchitecture=CNN-based, Resolution=256x2562022.04 | 99.08 | 4.28 | |
| Concat (Ti)Architecture=Transformer-based, Scale=Tiny, Resolution=256x2562022.04 | 102.7 | 4.74 | |
| Align.Architecture=CNN-based, Resolution=256x2562022.04 | 105.03 | 4.91 |