Resource Efficiency Analysis on Vision-Language Models General
0.66Pre-training Cost (PFlops Days)Prismer_BASE
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Prismer_BASEModel Params.=980M, Pre-training Data (# Image-Text Pairs)=12.7M, Input image tokens=256, Input text tokens=302023.03 | 0.66 | 0.2 | |
| Prismer_LARGEModel Params.=1.6B, Pre-training Data (# Image-Text Pairs)=12.7M, Input image tokens=256, Input text tokens=302023.03 | 1.9 | 0.38 | |
| BLIP_LARGEModel Params.=583M, Pre-training Data (# Image-Text Pairs)=129M, Input image tokens=256, Input text tokens=302023.03 | 22.2 | 0.17 | |
| GITModel Params.=681M, Pre-training Data (# Image-Text Pairs)=0.8B, Input image tokens=256, Input text tokens=302023.03 | 45.8 | 0.37 | |
| SimVLM_HUGEModel Params.=1.4B, Pre-training Data (# Image-Text Pairs)=1.8B, Input image tokens=256, Input text tokens=302023.03 | 66.9 | 0.4 | |
| PaLIModel Params.=17B, Pre-training Data (# Image-Text Pairs)=2.3B, Input image tokens=256, Input text tokens=302023.03 | 450 | 5.7 | |
| FlamingoModel Params.=80B, Pre-training Data (# Image-Text Pairs)=2.3B, Input image tokens=256, Input text tokens=302023.03 | 1,400 | 23 | |
| GIT-2Model Params.=5.1B, Pre-training Data (# Image-Text Pairs)=12.9B, Input image tokens=256, Input text tokens=302023.03 | 5,500 | 2.6 |