Fine-grained captioning on Dream1k
29.5F1 ScoreFluxViT-L
Evaluation Results
| Method | Links | |
|---|---|---|
| FluxViT-LEncoder=FluxViT-L, #Tokens=2048, Token Optimization=true, Evaluation Protocol=linear probe2025.03 | 29.5 | |
| SigLIP336-LEncoder=SigLIP336-L, #Tokens=8x576, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 29.2 | |
| FluxViT-LEncoder=FluxViT-L, #Tokens=8x256, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 29 | |
| InternVideo2-LEncoder=InternVideo2-L, #Tokens=8x224, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 28.7 | |
| FluxViT-LEncoder=FluxViT-L, #Tokens=1024, Token Optimization=true, Evaluation Protocol=linear probe2025.03 | 28.5 | |
| Clip-LEncoder=Clip-L, #Tokens=8x256, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 28.4 | |
| FluxViT-LEncoder=FluxViT-L, #Tokens=4x256, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 27.9 | |
| FluxViT-LEncoder=FluxViT-L, #Tokens=512, Token Optimization=true, Evaluation Protocol=linear probe2025.03 | 27.5 | |
| FluxViT-LEncoder=FluxViT-L, #Tokens=2x256, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 25.6 | |
| SigLIP336-LEncoder=SigLIP336-L, #Tokens=4x576, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 25.4 | |
| UMT-LEncoder=UMT-L, #Tokens=4x256, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 24.6 |