Visual Question Answering on T-VQA (Accuracy)
39.2AccuracySuperClass
Evaluation Results
| Method | Links | |
|---|---|---|
| SuperClassLLM Backbone=Vicuna-7B2024.11 | 39.2 | |
| OpenCLIPLLM Backbone=Vicuna-7B2024.11 | 38.16 | |
| DINOv2LLM Backbone=Vicuna-7B2024.11 | 14.08 | |
| MAELLM Backbone=Vicuna-7B2024.11 | 11.55 |