Utility Evaluation on ScienceQA (S-QA)
73.2AccuracyCMRM_dataset
Evaluation Results
| Method | Links | |
|---|---|---|
| CMRM_datasetBackbone=LLaVA-v1.5-13B2024.10 | 73.2 | |
| LLaVA-v1.5-13B2024.10 | 73.1 | |
| VLGuard MixedBackbone=LLaVA-v1.5-13B2024.10 | 72.84 | |
| CMRM_sampleBackbone=LLaVA-v1.5-13B2024.10 | 72.65 | |
| VLGuard PHBackbone=LLaVA-v1.5-13B2024.10 | 72.15 | |
| VLGuard MixedBackbone=LLaVA-v1.5-7B2024.10 | 69.28 | |
| LLaVA-v1.5-7B2024.10 | 68.03 | |
| VLGuard PHBackbone=LLaVA-v1.5-7B2024.10 | 67.32 | |
| ShareGPT4V2024.10 | 66.73 | |
| CMRM_sampleBackbone=LLaVA-v1.5-7B2024.10 | 66.14 | |
| CMRM_sampleBackbone=ShareGPT4V2024.10 | 66.13 | |
| CMRM_datasetBackbone=LLaVA-v1.5-7B2024.10 | 65.89 | |
| CMRM_datasetBackbone=ShareGPT4V2024.10 | 65.24 |