Medical Visual Question Answering (Multiple-Choice) on IU-XRay (test)
96.05AccuracyLIAR
Evaluation Results
| Method | Links | |
|---|---|---|
| LIARModel=GPT-5, Retriever=BGE-VL2026.05 | 96.05 | |
| Clean RAG (avg.)Model=GPT-5, Retriever=Average2026.05 | 94.2 | |
| M³AttModel=GPT-5, Retriever=BGE-VL2026.05 | 91.73 | |
| LIARModel=GPT-4o, Retriever=CLIP2026.05 | 89.89 | |
| Clean RAG (avg.)Model=GPT-4o, Retriever=Average2026.05 | 89.63 | |
| LIARModel=GPT-4o, Retriever=BGE-VL2026.05 | 88.6 | |
| w/o RAGModel=GPT-4o, Retriever=None2026.05 | 87.41 | |
| LIARModel=GPT-5, Retriever=CLIP2026.05 | 87.21 | |
| M³AttModel=GPT-4o, Retriever=CLIP2026.05 | 86.52 | |
| M³AttModel=GPT-4o, Retriever=BGE-VL2026.05 | 85.93 | |
| w/o RAGModel=GPT-5, Retriever=None2026.05 | 84.44 | |
| M³AttModel=GPT-5, Retriever=CLIP2026.05 | 84.29 | |
| LIARModel=GPT-4o, Retriever=Filtered2026.05 | 81.53 | |
| LIARModel=GPT-5, Retriever=Filtered2026.05 | 80.76 | |
| M³AttModel=GPT-4o, Retriever=Filtered2026.05 | 77.04 | |
| M³AttModel=GPT-5, Retriever=Filtered2026.05 | 76.29 | |
| LIARModel=Claude-4.5, Retriever=CLIP2026.05 | 73 | |
| LIARModel=Claude-4.5, Retriever=BGE-VL2026.05 | 68.92 | |
| Clean RAG (avg.)Model=Claude-4.5, Retriever=Average2026.05 | 67.69 | |
| M³AttModel=Claude-4.5, Retriever=CLIP2026.05 | 67.6 | |
| Clean RAG (avg.)Model=Gemini-2.5, Retriever=Average2026.05 | 66.28 | |
| w/o RAGModel=Claude-4.5, Retriever=None2026.05 | 65.92 | |
| LIARModel=Gemini-2.5, Retriever=CLIP2026.05 | 65.17 | |
| M³AttModel=Claude-4.5, Retriever=BGE-VL2026.05 | 65.07 | |
| LIARModel=Gemini-2.5, Retriever=BGE-VL2026.05 | 60.65 | |
| M³AttModel=Gemini-2.5, Retriever=CLIP2026.05 | 59.47 | |
| M³AttModel=Gemini-2.5, Retriever=BGE-VL2026.05 | 56.52 | |
| LIARModel=Claude-4.5, Retriever=Filtered2026.05 | 55.44 | |
| M³AttModel=Claude-4.5, Retriever=Filtered2026.05 | 51.11 | |
| w/o RAGModel=Gemini-2.5, Retriever=None2026.05 | 49.63 | |
| LIARModel=LLaVA-Med, Retriever=CLIP2026.05 | 48.04 | |
| LIARModel=Gemini-2.5, Retriever=Filtered2026.05 | 44.83 | |
| M³AttModel=Gemini-2.5, Retriever=Filtered2026.05 | 41.48 | |
| M³AttModel=LLaVA-Med, Retriever=CLIP2026.05 | 36.96 | |
| Clean RAG (avg.)Model=LLaVA-Med, Retriever=Average2026.05 | 25.77 | |
| LIARModel=LLaVA-Med, Retriever=BGE-VL2026.05 | 4.51 | |
| M³AttModel=LLaVA-Med, Retriever=BGE-VL2026.05 | 3.51 | |
| LIARModel=LLaVA-Med, Retriever=Filtered2026.05 | 1.56 | |
| w/o RAGModel=LLaVA-Med, Retriever=None2026.05 | 0 | |
| M³AttModel=LLaVA-Med, Retriever=Filtered2026.05 | 0 |