Medical Question Answering on MMLU-P
97.1AccuracyGPT-4.1-mini
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4.1-miniRetrieval Configuration=Our Framework2026.02 | 97.1 | |
| Gemini 2.5Retrieval Configuration=Our Framework2026.02 | 97.1 | |
| DeepSeek-ChatRetrieval Configuration=Our Framework2026.02 | 91 | |
| Gemini 2.5Retrieval Configuration=with RAG2026.02 | 90.5 | |
| GPT-4.1-miniRetrieval Configuration=with RAG2026.02 | 88.7 | |
| Gemini 2.5Retrieval Configuration=Baselines without Retrieval2026.02 | 87.5 | |
| DeepSeek-ChatRetrieval Configuration=with RAG2026.02 | 87.5 | |
| GPT-4.1-miniRetrieval Configuration=Baselines without Retrieval2026.02 | 86.8 | |
| DeepSeek-ChatRetrieval Configuration=Baselines without Retrieval2026.02 | 85.7 | |
| m1-32B-1KParameter Scale=32B, Thinking Budget=1K2025.04 | 76.94 | |
| MA-RAG-intBackbone=Qwen3-8B, Ranking Agent=intrinsic uncertainty2026.02 | 70.9 | |
| MA-RAG-extBackbone=Qwen3-8B, Ranking Agent=extrinsic verification2026.02 | 70.7 | |
| Multi-RefineBackbone=Qwen3-8B2026.02 | 69.1 | |
| SCBackbone=Qwen3-8B2026.02 | 66.5 | |
| SR-RAGBackbone=Qwen3-8B2026.02 | 66.1 | |
| m1-7B-23KParameter Scale=7B, Thinking Budget=23K2025.04 | 65.86 | |
| m1-7B-1KParameter Scale=7B, Thinking Budget=1K2025.04 | 65.15 | |
| Qwen3-8BBackbone=Qwen3-8B2026.02 | 64.9 | |
| FL-RAGBackbone=Qwen3-8B2026.02 | 64.1 | |
| TC-RAGBackbone=Qwen3-8B2026.02 | 63.6 | |
| CoTBackbone=Qwen3-8B2026.02 | 63.4 | |
| FLAREBackbone=Qwen3-8B2026.02 | 62.2 | |
| FS-RAGBackbone=Qwen3-8B2026.02 | 59.5 | |
| Llama-3.1-8BBackbone=Llama-3.1-8B2026.02 | 58 | |
| MedLlama3-8B-v2Parameter Scale=8B2025.04 | 55.11 | |
| HuatuoGPT-o1-8BBackbone=HuatuoGPT-o1-8B2026.02 | 54 | |
| OpenBioLLM-8BParameter Scale=8B2025.04 | 49.32 | |
| UltraMedical-3.1-8BBackbone=UltraMedical-3.1-8B2026.02 | 48.5 | |
| MedLlama3-8B-v1Parameter Scale=8B2025.04 | 27.43 |