Multimodal Deception Detection on MM-DeceptionBench
0.822AccuracyDebate with images
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Debate with imagesModel=Gemini-2.5-Pro2025.11 | 0.822 | 0.52 | 0.88 | |
| CoT promptModel=Gemini-2.5-Pro2025.11 | 0.805 | 0.52 | 0.86 | |
| Majority voteModel=Gemini-2.5-Pro2025.11 | 0.8 | 0.52 | 0.84 | |
| Debate with imagesModel=Claude-Sonnet-42025.11 | 0.8 | 0.5 | 0.86 | |
| Debate about imagesModel=Gemini-2.5-Pro2025.11 | 0.799 | 0.46 | 0.86 | |
| Direct promptModel=Gemini-2.5-Pro2025.11 | 0.788 | 0.48 | 0.85 | |
| Majority voteModel=Claude-Sonnet-42025.11 | 0.775 | 0.45 | 0.84 | |
| Debate with imagesModel=Qwen2.5-VL-72B2025.11 | 0.773 | 0.49 | 0.83 | |
| Direct promptModel=Claude-Sonnet-42025.11 | 0.761 | 0.41 | 0.83 | |
| Debate with imagesModel=GPT-4o2025.11 | 0.76 | 0.46 | 0.82 | |
| CoT promptModel=Claude-Sonnet-42025.11 | 0.759 | 0.45 | 0.78 | |
| Debate about imagesModel=Claude-Sonnet-42025.11 | 0.745 | 0.42 | 0.81 | |
| Debate about imagesModel=GPT-4o2025.11 | 0.735 | 0.43 | 0.79 | |
| Debate about imagesModel=Qwen2.5-VL-72B2025.11 | 0.72 | 0.43 | 0.77 | |
| Majority voteModel=Qwen2.5-VL-72B2025.11 | 0.692 | 0.4 | 0.74 | |
| Direct promptModel=Qwen2.5-VL-72B2025.11 | 0.656 | 0.35 | 0.7 | |
| CoT promptModel=Qwen2.5-VL-72B2025.11 | 0.63 | 0.33 | 0.66 | |
| Direct promptModel=GPT-4o2025.11 | 0.615 | 0.3 | 0.65 | |
| Majority voteModel=GPT-4o2025.11 | 0.59 | 0.27 | 0.62 | |
| CoT promptModel=GPT-4o2025.11 | 0.473 | 0.16 | 0.42 |