Medical Visual Question Answering (True/False) on MIMIC (test)
73.2AccuracyLIAR
Evaluation Results
| Method | Links | |
|---|---|---|
| LIARModel=GPT-5, Retriever=BGE-VL2026.05 | 73.2 | |
| Clean RAG (avg.)Model=GPT-5, Retriever=Average2026.05 | 73.16 | |
| M³AttModel=GPT-5, Retriever=BGE-VL2026.05 | 66.7 | |
| LIARModel=GPT-5, Retriever=CLIP2026.05 | 66.4 | |
| w/o RAGModel=LLaVA-Med, Retriever=None2026.05 | 66 | |
| Clean RAG (avg.)Model=LLaVA-Med, Retriever=Average2026.05 | 65.88 | |
| M³AttModel=GPT-5, Retriever=CLIP2026.05 | 63.46 | |
| LIARModel=LLaVA-Med, Retriever=BGE-VL2026.05 | 61.86 | |
| w/o RAGModel=GPT-5, Retriever=None2026.05 | 61.34 | |
| LIARModel=LLaVA-Med, Retriever=CLIP2026.05 | 61.04 | |
| LIARModel=GPT-5, Retriever=Filtered2026.05 | 58.46 | |
| M³AttModel=LLaVA-Med, Retriever=CLIP2026.05 | 55.44 | |
| M³AttModel=LLaVA-Med, Retriever=BGE-VL2026.05 | 51.3 | |
| M³AttModel=GPT-5, Retriever=Filtered2026.05 | 50 | |
| Clean RAG (avg.)Model=Claude-4.5, Retriever=Average2026.05 | 41.26 | |
| LIARModel=GPT-4o, Retriever=CLIP2026.05 | 40.96 | |
| Clean RAG (avg.)Model=Gemini-2.5, Retriever=Average2026.05 | 40.6 | |
| Clean RAG (avg.)Model=GPT-4o, Retriever=Average2026.05 | 37.84 | |
| LIARModel=GPT-4o, Retriever=BGE-VL2026.05 | 37.22 | |
| M³AttModel=GPT-4o, Retriever=CLIP2026.05 | 36.78 | |
| LIARModel=Gemini-2.5, Retriever=CLIP2026.05 | 36.18 | |
| LIARModel=Claude-4.5, Retriever=BGE-VL2026.05 | 35.9 | |
| LIARModel=Claude-4.5, Retriever=CLIP2026.05 | 34.48 | |
| M³AttModel=Gemini-2.5, Retriever=CLIP2026.05 | 33.76 | |
| LIARModel=Gemini-2.5, Retriever=BGE-VL2026.05 | 32.92 | |
| M³AttModel=GPT-4o, Retriever=BGE-VL2026.05 | 30.78 | |
| LIARModel=LLaVA-Med, Retriever=Filtered2026.05 | 30.62 | |
| M³AttModel=Gemini-2.5, Retriever=BGE-VL2026.05 | 29.58 | |
| M³AttModel=Claude-4.5, Retriever=CLIP2026.05 | 28.68 | |
| LIARModel=Gemini-2.5, Retriever=Filtered2026.05 | 26.54 | |
| M³AttModel=Claude-4.5, Retriever=BGE-VL2026.05 | 24.5 | |
| w/o RAGModel=GPT-4o, Retriever=None2026.05 | 24 | |
| M³AttModel=LLaVA-Med, Retriever=Filtered2026.05 | 23.34 | |
| w/o RAGModel=Gemini-2.5, Retriever=None2026.05 | 22.66 | |
| M³AttModel=Gemini-2.5, Retriever=Filtered2026.05 | 21.34 | |
| LIARModel=GPT-4o, Retriever=Filtered2026.05 | 21.08 | |
| M³AttModel=GPT-4o, Retriever=Filtered2026.05 | 14 | |
| w/o RAGModel=Claude-4.5, Retriever=None2026.05 | 0 | |
| LIARModel=Claude-4.5, Retriever=Filtered2026.05 | 0 | |
| M³AttModel=Claude-4.5, Retriever=Filtered2026.05 | 0 |