Medical Question Answering on MedBullets (test)
82.79AccuracyClinicalAgents
Evaluation Results
| Method | Links | |
|---|---|---|
| ClinicalAgentsCategory=Multi-Agents2026.03 | 82.79 | |
| MedChain-AgentsCategory=Multi-Agents2026.03 | 81.82 | |
| MedAgentsCategory=Multi-Agents2026.03 | 80.84 | |
| ReConcileCategory=Multi-Agents2026.03 | 80.52 | |
| ReActCategory=Single Agent2026.03 | 80.19 | |
| DeepSeek-R1Category=Single LLM2026.03 | 79.87 | |
| Few-shot + CoTCategory=Single Agent2026.03 | 79.87 | |
| AutoGenCategory=Multi-Agents2026.03 | 79.55 | |
| RAGCategory=Single Agent2026.03 | 79.22 | |
| GPT-5.2Category=Single LLM2026.03 | 78.9 | |
| MDAgentsCategory=Multi-Agents2026.03 | 77.27 | |
| Llama-4-Maverick-17BCategory=Single LLM2026.03 | 76.95 | |
| ColaCareCategory=Multi-Agents2026.03 | 76.62 | |
| Intern-S1Category=Single LLM2026.03 | 72.4 | |
| Qwen3-VL-235BCategory=Single LLM2026.03 | 67.21 | |
| FineMedLM-o1-8BCategory=Single LLM2026.03 | 60.39 | |
| HuaTuoGPT-o1-7BCategory=Single LLM2026.03 | 59.74 | |
| MedGemma-4BCategory=Single LLM2026.03 | 58.12 | |
| OursBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Ours, Number of Selected Examples=20002026.06 | 0.628 | |
| RandomBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Random, Number of Selected Examples=20002026.06 | 0.578 | |
| Middle PerplexityBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Middle Perplexity, Number of Selected Examples=20002026.06 | 0.578 | |
| S2LBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=S2L, Number of Selected Examples=20002026.06 | 0.567 | |
| LearnabilityBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Learnability, Number of Selected Examples=20002026.06 | 0.558 | |
| Embedding DiversityBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Embedding Diversity, Number of Selected Examples=20002026.06 | 0.547 |