Text-to-Image Generation on ImageNet 256x256 (test val)
2.453FIDCSFM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CSFMTarget Latent=RAE (DINOv2), Model Architecture=Identical2026.02 | 2.453 | 0.3433 | |
| Standard FMTarget Latent=RAE (DINOv2), Model Architecture=Identical2026.02 | 2.925 | 0.3396 | |
| CrossFlowTarget Latent=RAE (DINOv2), Model Architecture=Identical2026.02 | 2.957 | 0.3301 | |
| C2OTTarget Latent=RAE (DINOv2), Model Architecture=Identical2026.02 | 3.365 | 0.3406 |