Visual Reasoning on NLVR2 v2 (dev)
88.7AccuracyX2-VLM_large
Evaluation Results
| Method | Links | |
|---|---|---|
| X2-VLM_large# Params=593M, Pre-training Data=More Data2022.11 | 88.7 | |
| X2-VLM_large# Params=593M, Pre-training Data=4M2022.11 | 87.2 | |
| X2-VLM_base# Params=255M, Pre-training Data=More Data2022.11 | 86.2 | |
| X2-VLM_base# Params=255M, Pre-training Data=4M2022.11 | 85.9 | |
| VLMo_large# Params=562M, Pre-training Data=4M2022.11 | 85.6 | |
| SimVLM_large# Params=783M, Pre-training Data=More Data2022.11 | 84.1 | |
| VLMo_base# Params=175M, Pre-training Data=4M2022.11 | 82.8 | |
| BLIP_base# Params=240M, Pre-training Data=More Data2022.11 | 82.5 | |
| METER# Params=341M, Pre-training Data=4M2022.11 | 82.3 | |
| VL-BEiT# Params=175M, Pre-training Data=4M2022.11 | 81.9 | |
| SimVLM_base# Params=273M, Pre-training Data=More Data2022.11 | 81.7 | |
| ALBEF# Params=210M, Pre-training Data=4M2022.11 | 80.2 | |
| CLOVAMethod Category=Tool, Backbone LLM=GPT-3.52023.12 | 65.6 | |
| MMICLMethod Category=E2E2023.12 | 62.2 | |
| VISPROGMethod Category=Tool, Backbone LLM=GPT-3.52023.12 | 60.8 | |
| Visual ChatGPTMethod Category=Tool, Backbone LLM=GPT-3.52023.12 | 51.6 | |
| OtterMethod Category=E2E2023.12 | 48.2 | |
| GPT4TOOLSMethod Category=Tool, Backbone LLM=GPT-3.52023.12 | 45.4 | |
| HuggingGPTMethod Category=Tool, Backbone LLM=GPT-3.52023.12 | 44 | |
| InternGPTMethod Category=Tool, Backbone LLM=GPT-3.52023.12 | 39.4 |