Object Recognition on OpenImages v7 (val)
66.3RecallNXTP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| NXTPmodels (vision + lang)=ViT L-14 + Langtruncated, data scale=70M, #params (B)=1.78, top-k=102023.12 | 66.3 | 56.4 | 60.3 | |
| InstructBLIPmodels (vision + lang)=ViT g-14 + Flant5xxl, prompt=caption, data scale=129M, #params (B)=12.3, top-k=102023.12 | 64.7 | 53.9 | 58.1 | |
| LLaVA 1.0models (vision + lang)=ViT L-14 + LLAMA 2, prompt=instruct, data scale=753K, #params (B)=13.3, top-k=102023.12 | 61.5 | 54.1 | 57 | |
| LLaVA 1.5models (vision + lang)=ViT L-14 + Vicuna, prompt=instruct, data scale=1.2M, #params (B)=13.4, top-k=102023.12 | 61.5 | 57.7 | 58.2 | |
| NXTPmodels (vision + lang)=ViT L-14 + Langtruncated, data scale=3M, #params (B)=1.78, top-k=102023.12 | 61.3 | 54.4 | 57 | |
| LLaVA 1.5models (vision + lang)=ViT L-14 + Vicuna, prompt=caption, data scale=1.2M, #params (B)=13.4, top-k=102023.12 | 61.1 | 50.8 | 54.9 | |
| LLaVA 1.0models (vision + lang)=ViT L-14 + LLAMA 2, prompt=caption, data scale=753K, #params (B)=13.3, top-k=102023.12 | 61 | 51.1 | 55 | |
| InstructBLIPmodels (vision + lang)=ViT g-14 + Flant5xxl, prompt=instruct, data scale=129M, #params (B)=12.3, top-k=102023.12 | 56.1 | 69.8 | 61.5 | |
| CaSEDmodels (vision + lang)=ViT L-14 + Retrieval, data scale=403M, #params (B)=0.43, top-k=102023.12 | 56 | 49.4 | 51.9 | |
| Flamingo_openmodels (vision + lang)=ViT L-14 + MPT, prompt=list, data scale=2.1B, #params (B)=8.13, top-k=102023.12 | 55.5 | 63.5 | 58.4 | |
| LLaVA 1.5models (vision + lang)=ViT L-14 + Vicuna, prompt=list, data scale=1.2M, #params (B)=13.4, top-k=102023.12 | 55.2 | 61.4 | 57.4 | |
| Flamingo_openmodels (vision + lang)=ViT L-14 + MPT, prompt=caption, data scale=2.1B, #params (B)=8.13, top-k=102023.12 | 55.1 | 61.3 | 57.4 | |
| InstructBLIPmodels (vision + lang)=ViT g-14 + Flant5xxl, prompt=list, data scale=129M, #params (B)=12.3, top-k=102023.12 | 54.4 | 63.4 | 57.8 | |
| LLaVA 1.0models (vision + lang)=ViT L-14 + LLAMA 2, prompt=list, data scale=753K, #params (B)=13.3, top-k=102023.12 | 54.3 | 64.1 | 58 | |
| Flamingo_openmodels (vision + lang)=ViT L-14 + LLAMA 1, prompt=caption, data scale=2.1B, #params (B)=8.34, top-k=102023.12 | 53.8 | 60.7 | 56.3 | |
| CaSEDmodels (vision + lang)=ViT L-14 + Retrieval, data scale=12M, #params (B)=0.43, top-k=102023.12 | 53.4 | 47 | 49.4 | |
| Flamingo_openmodels (vision + lang)=ViT L-14 + LLAMA 1, prompt=list, data scale=2.1B, #params (B)=8.34, top-k=102023.12 | 52.6 | 62.1 | 56.2 | |
| BLIP-2models (vision + lang)=ViT g-14 + Flant5xxl, prompt=caption, data scale=129M, #params (B)=12.2, top-k=102023.12 | 52.3 | 62.6 | 56.1 | |
| CLIPmodels (vision + lang)=ViT L-14 + CLIPlang, data scale=400M, #params (B)=0.43, top-k=102023.12 | 51 | 46.2 | 48 | |
| BLIP-2models (vision + lang)=ViT g-14 + Flant5xxl, prompt=list, data scale=129M, #params (B)=12.2, top-k=102023.12 | 47.6 | 64.1 | 53.8 | |
| CLIPmodels (vision + lang)=ViT L-14 + CLIPlang, data scale=400M, #params (B)=0.43, top-k=102023.12 | 38.6 | 36.3 | 37.1 |