Multi-discipline Multimodal Understanding on CMMMU
25.3Overall AccuracyMAGIC
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MAGICTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 25.3 | — | — | |
| ICONSTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 25.2 | — | — | |
| PerplexityTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 23.9 | — | — | |
| SemDeDupTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 22.8 | — | — | |
| Full-FinetuneTraining Budget=100%, Backbone=LLaVA-1.5-13B2026.05 | 22.1 | — | — | |
| RandomTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 21.9 | — | — | |
| D2-PruningTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 21.9 | — | — | |
| EL2NTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 21.7 | — | — | |
| COINCIDETraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 21.4 | — | — | |
| RDSTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 21.3 | — | — | |
| Self-SupTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 21 | — | — | |
| CLIP-ScoreTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 20.8 | — | — | |
| Self-FilterTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 20.6 | — | — | |
| CLIPLLM=Qwen2-7B, Vision Tower=ViT-L/142024.07 | — | 33.7 | 72.03 | |
| CLIPLLM=Qwen2-72B, Vision Tower=ViT-L/142024.07 | — | 37.45 | 76.63 | |
| MLCDLLM=Qwen2-7B, Vision Tower=ViT-L/142024.07 | — | 33.1 | 73.88 | |
| MLCDLLM=Qwen2-72B, Vision Tower=ViT-L/142024.07 | — | 41.2 | 78.59 |