General spatiotemporal perception on MVbench
49ScoreFluxViT-L
Evaluation Results
| Method | Links | |
|---|---|---|
| FluxViT-LEncoder=FluxViT-L, #Tokens=2048, Token Optimization=true, Evaluation Protocol=linear probe2025.03 | 49 | |
| FluxViT-LEncoder=FluxViT-L, #Tokens=8x256, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 48.3 | |
| FluxViT-LEncoder=FluxViT-L, #Tokens=1024, Token Optimization=true, Evaluation Protocol=linear probe2025.03 | 47.7 | |
| FluxViT-LEncoder=FluxViT-L, #Tokens=512, Token Optimization=true, Evaluation Protocol=linear probe2025.03 | 47.6 | |
| InternVideo2-LEncoder=InternVideo2-L, #Tokens=8x224, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 47 | |
| FluxViT-LEncoder=FluxViT-L, #Tokens=4x256, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 46.9 | |
| SigLIP336-LEncoder=SigLIP336-L, #Tokens=8x576, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 46.7 | |
| FluxViT-LEncoder=FluxViT-L, #Tokens=2x256, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 46 | |
| Clip-LEncoder=Clip-L, #Tokens=8x256, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 45.6 | |
| UMT-LEncoder=UMT-L, #Tokens=4x256, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 45 | |
| SigLIP336-LEncoder=SigLIP336-L, #Tokens=4x576, Token Optimization=false, Evaluation Protocol=linear probe2025.03 | 44.5 |