Medical Question Answering on MedMCQA (test)
84.13AccuracyGemini2.5-Pro
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini2.5-ProModel Group=Awesome General Models2026.01 | 84.13 | — | |
| DEEPMED-14B-RLModel Group=DeepResearch Models, Training Stage=RL2026.01 | 82.6 | — | |
| Deepseek-v3.2-685BModel Group=Awesome General Models2026.01 | 81.38 | — | |
| Kimi-K2-Thinking-1TBModel Group=Awesome General Models2026.01 | 80.3 | — | |
| DEEPMED-14B-SFTModel Group=DeepResearch Models, Training Stage=SFT2026.01 | 79.37 | — | |
| OPCDModel=Llama-3.1-8B-Ins2026.02 | 76.7 | — | |
| OPCDModel=Llama-3.2-3B-Ins2026.02 | 76.3 | — | |
| AlphaMed-70BModel Group=Medical Reasoning Models2026.01 | 75.89 | — | |
| QuarkMed-32BModel Group=Medical Reasoning Models2026.01 | 75.5 | — | |
| Tongyi-DeepResearch-30BA3BModel Group=DeepResearch Models2026.01 | 75.21 | — | |
| Context Distill.Model=Llama-3.1-8B-Ins2026.02 | 75.2 | — | |
| MEDAGENTSBase Model=GPT-42023.11 | 74.8 | — | |
| AU-ProbeModel=Bio-Medical-Llama-3-8B, Clarification Threshold=0.52026.01 | 73.9 | 17.5 | |
| HuatuoGPT-o1-70BModel Group=Medical Reasoning Models2026.01 | 73.61 | — | |
| Qwen3-30BA3B-ThinkingModel Group=Awesome General Models2026.01 | 73.11 | — | |
| GPT-4Model=GPT-4, Setting=Few-Shot2025.12 | 72.3 | — | |
| In-ContextModel=Llama-3.1-8B-Ins2026.02 | 72.2 | — | |
| Context Distill.Model=Llama-3.2-3B-Ins2026.02 | 71 | — | |
| GPT-4Model=GPT-4, Setting=Zero-Shot2025.12 | 69.5 | — | |
| BaiChuan-M2-32BModel Group=Medical Reasoning Models2026.01 | 68.49 | — | |
| Base ModelModel=Llama-3.1-8B-Ins2026.02 | 68.4 | — | |
| Qwen3-14BModel Group=Awesome General Models2026.01 | 68.18 | — | |
| QWEN3-14BModel Architecture=QWEN3-14B, Configuration Type=Dense, Evaluation Protocol=5-shot, Sparsity Level=0%2026.01 | 68.09 | — | |
| M1-1K-32BModel Group=Medical Reasoning Models2026.01 | 67.37 | — | |
| kNN-MoEBackbone=Qwen32026.01 | 66.65 | — | |
| SFTBackbone=Qwen32026.01 | 66.6 | — | |
| 5-shotBackbone=Qwen32026.01 | 66.58 | — | |
| In-ContextModel=Llama-3.2-3B-Ins2026.02 | 66.4 | — | |
| SFT (Router Only)Backbone=Qwen32026.01 | 66.03 | — | |
| LLaMA 2 + RAGModel=LLaMA 2, Setting=Fine-Tuned + RAG2025.12 | 64.3 | — | |
| ASK4CONFModel=Bio-Medical-Llama-3-8B, Clarification Threshold=0.52026.01 | 63.4 | — | |
| Zero-shotBackbone=Qwen32026.01 | 62.51 | — | |
| OPCDModel=Qwen2.5-7B-Ins2026.02 | 62.3 | — | |
| Falcon + RAGModel=Falcon, Setting=Fine-Tuned + RAG2025.12 | 61.7 | — | |
| QWEN3-4BModel Architecture=QWEN3-4B, Configuration Type=Dense, Evaluation Protocol=5-shot, Sparsity Level=0%2026.01 | 59.6 | — | |
| Base ModelModel=Llama-3.2-3B-Ins2026.02 | 59.4 | — | |
| MEDAGENTSBase Model=GPT-3.52023.11 | 59.3 | — | |
| Context Distill.Model=Qwen2.5-7B-Ins2026.02 | 58.5 | — | |
| M1-1K-7BModel Group=Medical Reasoning Models2026.01 | 58.26 | — | |
| CriSPOModel=Claude Sonnet, Shots=0-shot2024.10 | 57.9 | — | |
| OPROModel=Claude Sonnet2024.10 | 57.7 | — | |
| CriSPOModel=Claude Sonnet, Shots=5-shot2024.10 | 57.4 | — | |
| MedResaon-8BModel Group=Medical Reasoning Models2026.01 | 57.25 | — | |
| kNN-MoEBackbone=GPT-OSS2026.01 | 57.06 | — | |
| LLaMA 2Model=LLaMA 2, Setting=Fine-Tuned2025.12 | 56.8 | — | |
| LLAMA-3.1-8BModel Architecture=LLAMA-3.1-8B, Configuration Type=Dense, Evaluation Protocol=5-shot, Sparsity Level=0%2026.01 | 56.66 | — | |
| AU-ProbeModel=Qwen2.5-7B, Clarification Threshold=0.52026.01 | 56.6 | 6.1 | |
| No ClarificationModel=Bio-Medical-Llama-3-8B, Clarification Threshold=N/A2026.01 | 56.4 | — | |
| Zero-shotBackbone=GPT-OSS2026.01 | 56.2 | — | |
| SFTBackbone=GPT-OSS2026.01 | 56.06 | — | |
| DEEPSEEK-R1-QWEN-8BModel Architecture=DEEPSEEK-R1-QWEN-8B, Configuration Type=Dense, Evaluation Protocol=5-shot, Sparsity Level=0%2026.01 | 55.89 | — | |
| SFT (Router Only)Backbone=GPT-OSS2026.01 | 54.89 | — | |
| CriSPOModel=Claude Instant, Shots=5-shot2024.10 | 54.4 | — | |
| ManualModel=Claude Sonnet, Shots=5-shot2024.10 | 54.4 | — | |
| AU-ProbeModel=Llama-3.1-8B, Clarification Threshold=0.52026.01 | 54.1 | 6 | |
| ManualModel=Claude Instant, Shots=5-shot2024.10 | 53.8 | — | |
| GPT-3.5 Turbo 1106shot=3-shot2024.02 | 53.79 | — | |
| FalconModel=Falcon, Setting=Fine-Tuned2025.12 | 53.5 | — | |
| 5-shotBackbone=GPT-OSS2026.01 | 52.76 | — | |
| In-ContextModel=Qwen2.5-7B-Ins2026.02 | 52.6 | — | |
| CriSPOModel=Claude Instant, Shots=0-shot2024.10 | 52.3 | — | |
| ASK4CONFModel=Qwen2.5-7B, Clarification Threshold=0.52026.01 | 51.3 | — | |
| OPROModel=Claude Instant2024.10 | 50.5 | — | |
| No ClarificationModel=Qwen2.5-7B, Clarification Threshold=N/A2026.01 | 50.5 | — | |
| ManualModel=Claude Sonnet, Shots=0-shot2024.10 | 49.8 | — | |
| ASK4CONFModel=Llama-3.1-8B, Clarification Threshold=0.52026.01 | 49.7 | — | |
| MISTRAL-7BModel Architecture=MISTRAL-7B, Configuration Type=Dense, Evaluation Protocol=5-shot, Sparsity Level=0%2026.01 | 49.29 | — | |
| ManualModel=Claude Instant, Shots=0-shot2024.10 | 49.2 | — | |
| LLAMA-3.2-3BModel Architecture=LLAMA-3.2-3B, Configuration Type=Dense, Evaluation Protocol=5-shot, Sparsity Level=0%2026.01 | 49.18 | — | |
| No ClarificationModel=Llama-3.1-8B, Clarification Threshold=N/A2026.01 | 48.1 | — | |
| LLaMA 2Model=LLaMA 2, Setting=Zero-Shot2025.12 | 47.2 | — | |
| Base ModelModel=Qwen2.5-7B-Ins2026.02 | 46.4 | — | |
| MedAlpacaModel Scale=7B2023.11 | 45.8 | — | |
| BioMistral 7B SLERPshot=3-shot2024.02 | 45.7 | — | |
| BioMistral 7B DAREshot=3-shot2024.02 | 44.9 | — | |
| BioMistral 7B Ensembleshot=3-shot2024.02 | 44.8 | — | |
| FalconModel=Falcon, Setting=Zero-Shot2025.12 | 44.8 | — | |
| DARTModel Architecture=QWEN3-14B, Configuration Type=Sparse, Evaluation Protocol=5-shot, Sparsity Level=70%2026.01 | 44.75 | — | |
| BioMistral 7B TIESshot=3-shot2024.02 | 44 | — | |
| BioMistral 7Bshot=3-shot2024.02 | 43.9 | — | |
| PADsource model=gemma3-27b-it, train dataset=gsm8k2026.02 | 43.52 | — | |
| DEEPSEEK-R1-LLAMA-8BModel Architecture=DEEPSEEK-R1-LLAMA-8B, Configuration Type=Dense, Evaluation Protocol=5-shot, Sparsity Level=0%2026.01 | 43.44 | — | |
| Mistral 7B Instructshot=3-shot2024.02 | 42.8 | — | |
| PADsource model=qwen3-32b, train dataset=gsm8k2026.02 | 42.46 | — | |
| DAsource model=gemma3-27b-it, train dataset=gsm8k2026.02 | 42.46 | — | |
| PADsource model=qwen3-8b, train dataset=gsm8k2026.02 | 42.25 | — | |
| DAsource model=qwen3-8b, train dataset=gsm8k2026.02 | 42.23 | — | |
| BioMedGPTModel Scale=10B2023.11 | 42.2 | — | |
| RSFTsource model=qwen3-8b, train dataset=gsm8k2026.02 | 41.89 | — | |
| AU-ProbeModel=BioMistral-7B, Clarification Threshold=0.52026.01 | 41.4 | 5.2 | |
| DAsource model=qwen3-32b, train dataset=gsm8k2026.02 | 40.94 | — | |
| SciBERTModel Scale=large2023.11 | 39.2 | — | |
| ASK4CONFModel=BioMistral-7B, Clarification Threshold=0.52026.01 | 38.8 | — | |
| RSFTsource model=qwen3-32b, train dataset=gsm8k2026.02 | 38.51 | — | |
| BioBERTModel Scale=large2023.11 | 37.1 | — | |
| kNN-MoEBackbone=OLMoE2026.01 | 37.01 | — | |
| DARTModel Architecture=DEEPSEEK-R1-QWEN-8B, Configuration Type=Sparse, Evaluation Protocol=5-shot, Sparsity Level=70%2026.01 | 36.89 | — | |
| No ClarificationModel=BioMistral-7B, Clarification Threshold=N/A2026.01 | 36.2 | — | |
| DARTModel Architecture=QWEN3-4B, Configuration Type=Sparse, Evaluation Protocol=5-shot, Sparsity Level=70%2026.01 | 36.12 | — | |
| Zero-shotBackbone=OLMoE2026.01 | 35.57 | — |