Multimodal Question Answering on MULTIMODALQA (test)
75.5Overall AccuracyUniMMQA (T5 3B)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| UniMMQA (T5 3B)Evaluation Protocol=Finetuned, Model Scale=3B2025.05 | 75.5 | — | — | |
| UniMMQA (T5 L)Evaluation Protocol=Finetuned, Model Scale=Large2025.05 | 71.3 | — | — | |
| AETGAEvaluation Protocol=Finetuned2025.05 | 68.8 | 69.8 | 64.7 | |
| UniMMQA (T5 B)Evaluation Protocol=Finetuned, Model Scale=Base2025.05 | 67.9 | — | — | |
| Our Agent 7BEvaluation Protocol=Zero-Shot, Model Scale=7B2025.05 | 67.56 | 73.16 | 58.93 | |
| UniRaGEvaluation Protocol=Finetuned2025.05 | 67.4 | 71.7 | 62.3 | |
| PERQAEvaluation Protocol=Finetuned2025.05 | 62.8 | 69.7 | 54.7 | |
| SKURGEvaluation Protocol=Finetuned2025.05 | 59.8 | 66.1 | 52.5 | |
| SolarEvaluation Protocol=Finetuned2025.05 | 59.8 | 69.7 | 55.5 | |
| PReasM LEvaluation Protocol=Finetuned, Model Scale=Large2025.05 | 59 | — | — | |
| MMQA-T5 LEvaluation Protocol=Finetuned, Model Scale=Large2025.05 | 57.9 | — | — | |
| Our Agent 3BEvaluation Protocol=Zero-Shot, Model Scale=3B2025.05 | 52.12 | 57.72 | 43.39 | |
| BinderEvaluation Protocol=Finetuned2025.05 | 51 | — | — | |
| ImplicitDecompEvaluation Protocol=Finetuned2025.05 | 48.8 | 51.6 | 44.6 | |
| AutoRoutingEvaluation Protocol=Finetuned2025.05 | 44.7 | 51.7 | 34.2 | |
| CoT Qwen 7BEvaluation Protocol=Zero-Shot, Backbone=Qwen, Model Scale=7B2025.05 | 33.84 | 36.07 | 30.91 | |
| CoT Qwen 3BEvaluation Protocol=Zero-Shot, Backbone=Qwen, Model Scale=3B2025.05 | 23.15 | 23.75 | 22.24 |