Vision-Language Reasoning on CODA-LM 1.0 (test)
79.8BarrierQwen2.5-VL-7B + Ours
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5-VL-7B + OursModel Size=7B, Strategy=Parameter-efficient refinement2026.02 | 79.8 | 73.8 | 91.7 | 64.3 | 54.3 | 71 | 58.4 | 75.4 | |
| CODA-LMStrategy=Task-specific finetuned2026.02 | 78.7 | 68.8 | 86.2 | 73.3 | 64.9 | 78.8 | 73.8 | 77.7 | |
| InternVL3-8B + OursModel Size=8B, Strategy=Parameter-efficient refinement2026.02 | 76.4 | 69.3 | 85.8 | 67.5 | 55.1 | 73.8 | 66.2 | 74.2 | |
| Qwen2.5-VL-7BModel Size=7B, Strategy=Frozen Baseline2026.02 | 70.9 | 62.5 | 84.9 | 48.8 | 52.1 | 66.5 | 54.6 | 67.9 | |
| LLaVA-1.5-13B + OursModel Size=13B, Strategy=Parameter-efficient refinement2026.02 | 70.1 | 59.6 | 87.1 | 53.1 | 51.4 | 73.4 | 57.5 | 71.2 | |
| MPDriveStrategy=Task-specific finetuned2026.02 | 70 | 62.8 | 77.7 | — | — | 79.5 | 70 | 76.1 | |
| LLaVA-1.5-7B + OursModel Size=7B, Strategy=Parameter-efficient refinement2026.02 | 68.3 | 68.3 | 84.9 | 61.4 | 48.2 | 73 | 56.1 | 72.8 | |
| MiniDriveStrategy=Task-specific finetuned2026.02 | 62.9 | 62.8 | 84.4 | — | — | 67.4 | 36 | 66.3 | |
| InternVL3-8BModel Size=8B, Strategy=Frozen Baseline2026.02 | 59.7 | 65.5 | 73.3 | 64.4 | 52.3 | 66.9 | 59.6 | 65.4 | |
| LLaVA-1.5-13BModel Size=13B, Strategy=Frozen Baseline2026.02 | 40.9 | 41.8 | 46.3 | 58.8 | 47.7 | 61 | 41.5 | 50.8 | |
| Jiang et al.Strategy=Training-free2026.02 | 40.3 | 41.4 | 52.1 | 60.8 | 45.9 | 49.4 | 43.1 | 46.7 | |
| LLaVA-1.5-7BModel Size=7B, Strategy=Frozen Baseline2026.02 | 39.3 | 40.2 | 54.5 | 54.4 | 48.8 | 48.9 | 40.5 | 46.5 | |
| ControlMLLM++Strategy=Training-free2026.02 | 39.3 | 45.4 | 53 | 62.2 | 46.6 | 50.1 | 39 | 47 |