Medical Visual Question Answering (Multiple-Choice) on MIMIC (test)
82.56AccuracyLIAR
Evaluation Results
| Method | Links | |
|---|---|---|
| LIARModel=GPT-5, Retriever=BGE-VL2026.05 | 82.56 | |
| Clean RAG (avg.)Model=GPT-5, Retriever=Average2026.05 | 81.24 | |
| w/o RAGModel=GPT-5, Retriever=None2026.05 | 74.69 | |
| LIARModel=GPT-5, Retriever=CLIP2026.05 | 74.5 | |
| M³AttModel=GPT-5, Retriever=BGE-VL2026.05 | 72.26 | |
| M³AttModel=GPT-5, Retriever=CLIP2026.05 | 70.33 | |
| Clean RAG (avg.)Model=GPT-4o, Retriever=Average2026.05 | 69.57 | |
| LIARModel=GPT-4o, Retriever=BGE-VL2026.05 | 67.83 | |
| Clean RAG (avg.)Model=Claude-4.5, Retriever=Average2026.05 | 66.41 | |
| LIARModel=Claude-4.5, Retriever=CLIP2026.05 | 66.38 | |
| LIARModel=Claude-4.5, Retriever=BGE-VL2026.05 | 64.68 | |
| LIARModel=GPT-4o, Retriever=CLIP2026.05 | 64.09 | |
| M³AttModel=Claude-4.5, Retriever=CLIP2026.05 | 61.41 | |
| M³AttModel=GPT-4o, Retriever=CLIP2026.05 | 59.98 | |
| w/o RAGModel=Claude-4.5, Retriever=None2026.05 | 59.26 | |
| M³AttModel=GPT-4o, Retriever=BGE-VL2026.05 | 58.84 | |
| w/o RAGModel=GPT-4o, Retriever=None2026.05 | 58.02 | |
| LIARModel=Gemini-2.5, Retriever=BGE-VL2026.05 | 55.62 | |
| M³AttModel=Claude-4.5, Retriever=BGE-VL2026.05 | 55.43 | |
| Clean RAG (avg.)Model=Gemini-2.5, Retriever=Average2026.05 | 52.66 | |
| LIARModel=GPT-5, Retriever=Filtered2026.05 | 47.03 | |
| M³AttModel=Gemini-2.5, Retriever=BGE-VL2026.05 | 46.34 | |
| M³AttModel=GPT-5, Retriever=Filtered2026.05 | 44.44 | |
| LIARModel=Gemini-2.5, Retriever=CLIP2026.05 | 42.09 | |
| M³AttModel=Gemini-2.5, Retriever=CLIP2026.05 | 39.21 | |
| LIARModel=GPT-4o, Retriever=Filtered2026.05 | 37.32 | |
| M³AttModel=GPT-4o, Retriever=Filtered2026.05 | 34.57 | |
| w/o RAGModel=Gemini-2.5, Retriever=None2026.05 | 33.96 | |
| LIARModel=Claude-4.5, Retriever=Filtered2026.05 | 32.97 | |
| M³AttModel=Claude-4.5, Retriever=Filtered2026.05 | 30.24 | |
| LIARModel=Gemini-2.5, Retriever=Filtered2026.05 | 22.37 | |
| M³AttModel=Gemini-2.5, Retriever=Filtered2026.05 | 20.99 | |
| LIARModel=LLaVA-Med, Retriever=Filtered2026.05 | 12.9 | |
| M³AttModel=LLaVA-Med, Retriever=Filtered2026.05 | 11.73 | |
| M³AttModel=LLaVA-Med, Retriever=CLIP2026.05 | 10.77 | |
| LIARModel=LLaVA-Med, Retriever=CLIP2026.05 | 10.74 | |
| w/o RAGModel=LLaVA-Med, Retriever=None2026.05 | 8.64 | |
| Clean RAG (avg.)Model=LLaVA-Med, Retriever=Average2026.05 | 8.5 | |
| M³AttModel=LLaVA-Med, Retriever=BGE-VL2026.05 | 6.36 | |
| LIARModel=LLaVA-Med, Retriever=BGE-VL2026.05 | 4.49 |