Multimodal Science Reasoning on ScienceQA (val)
79.92AccuracyMoD-Multi Round
Evaluation Results
| Method | Links | |
|---|---|---|
| MoD-Multi RoundBackbone=Qwen2.5VL-3b-Instruct, Protocol=multi-turn dialectical reasoning2026.06 | 79.92 | |
| MoD-Single RoundBackbone=Qwen2.5VL-3b-Instruct, Protocol=single-round inference2026.06 | 79.87 | |
| Self-CorrectionBackbone=Qwen2.5VL-3b-Instruct2026.06 | 79.73 | |
| MoE-LoRABackbone=Qwen2.5VL-3b-Instruct2026.06 | 79.64 | |
| Multi-Agent DebateBackbone=Qwen2.5VL-3b-Instruct2026.06 | 79.45 | |
| Qwen2.5VL-3b-Instruct2026.06 | 79.3 | |
| Gemma-3-4B2026.06 | 76 | |
| MoD-Multi RoundBackbone=LLaVA-v1.6-13b, Protocol=multi-turn dialectical reasoning2026.06 | 72.1 | |
| MoD-Single RoundBackbone=LLaVA-v1.6-13b, Protocol=single-round inference2026.06 | 71.67 | |
| MoE-LoRABackbone=LLaVA-v1.6-13b2026.06 | 71.56 | |
| Multi-Agent DebateBackbone=LLaVA-v1.6-13b2026.06 | 71.23 | |
| Self-CorrectionBackbone=LLaVA-v1.6-13b2026.06 | 70.98 | |
| ShareGPT4V-13B2026.06 | 70.7 | |
| LLaVA-v1.6-13b2026.06 | 70.65 | |
| LLaVA-Next-Mistral-7B2026.06 | 69.5 | |
| Qwen-VL-Chat2026.06 | 65.5 | |
| InstructBLIP-7B2026.06 | 54.7 |