Visual Question Answering on MIMICEchoQA (test)
76AccuracyEchoTrust
Evaluation Results
| Method | Links | |
|---|---|---|
| EchoTrust2026.04 | 76 | |
| CoT: Qwen3-VL-4B-InstructModel Size=4B, Model Variant=Instruct, Prompting Strategy=Chain-of-Thought2026.04 | 46 | |
| Qwen3-VL-8B-InstructModel Size=8B, Model Variant=Instruct, Prompting Strategy=Standard2026.04 | 44 | |
| Qwen3-VL-32B-InstructModel Size=32B, Model Variant=Instruct, Prompting Strategy=Standard2026.04 | 44 | |
| CoT: Qwen3-VL-2B-InstructModel Size=2B, Model Variant=Instruct, Prompting Strategy=Chain-of-Thought2026.04 | 44 | |
| Qwen3-VL-2B-InstructModel Size=2B, Model Variant=Instruct, Prompting Strategy=Standard2026.04 | 43 | |
| Qwen3-VL-4B-InstructModel Size=4B, Model Variant=Instruct, Prompting Strategy=Standard2026.04 | 40 | |
| CoT: Qwen3-VL-8B-ThinkingModel Size=8B, Model Variant=Thinking, Prompting Strategy=Chain-of-Thought2026.04 | 40 | |
| CoT: Qwen3-VL-32B-ThinkingModel Size=32B, Model Variant=Thinking, Prompting Strategy=Chain-of-Thought2026.04 | 38 | |
| CoT: Qwen3-VL-8B-InstructModel Size=8B, Model Variant=Instruct, Prompting Strategy=Chain-of-Thought2026.04 | 37 | |
| CoT: Qwen3-VL-32B-InstructModel Size=32B, Model Variant=Instruct, Prompting Strategy=Chain-of-Thought2026.04 | 37 | |
| Qwen3-VL-8B-ThinkingModel Size=8B, Model Variant=Thinking, Prompting Strategy=Standard2026.04 | 34 | |
| Qwen3-VL-4B-ThinkingModel Size=4B, Model Variant=Thinking, Prompting Strategy=Standard2026.04 | 30 | |
| Qwen3-VL-32B-ThinkingModel Size=32B, Model Variant=Thinking, Prompting Strategy=Standard2026.04 | 29 | |
| CoT: Qwen3-VL-4B-ThinkingModel Size=4B, Model Variant=Thinking, Prompting Strategy=Chain-of-Thought2026.04 | 26 | |
| Qwen3-VL-2B-ThinkingModel Size=2B, Model Variant=Thinking, Prompting Strategy=Standard2026.04 | 25 | |
| CoT: Qwen3-VL-2B-ThinkingModel Size=2B, Model Variant=Thinking, Prompting Strategy=Chain-of-Thought2026.04 | 23 |