Medical Question Answering on NEJM
73.13Accuracym1-32B-1K
Evaluation Results
| Method | Links | |
|---|---|---|
| m1-32B-1KParameter Scale=32B, Thinking Budget=1K2025.04 | 73.13 | |
| m1-7B-23KParameter Scale=7B, Thinking Budget=23K2025.04 | 64.34 | |
| MA-RAG-intBackbone=Qwen3-8B, Ranking Agent=intrinsic uncertainty2026.02 | 60.8 | |
| MA-RAG-extBackbone=Qwen3-8B, Ranking Agent=extrinsic verification2026.02 | 60.5 | |
| Multi-RefineBackbone=Qwen3-8B2026.02 | 58 | |
| TC-RAGBackbone=Qwen3-8B2026.02 | 57.7 | |
| SR-RAGBackbone=Qwen3-8B2026.02 | 57.6 | |
| FL-RAGBackbone=Qwen3-8B2026.02 | 57.2 | |
| SCBackbone=Qwen3-8B2026.02 | 56.6 | |
| CoTBackbone=Qwen3-8B2026.02 | 56.2 | |
| Qwen3-8BBackbone=Qwen3-8B2026.02 | 56 | |
| FLAREBackbone=Qwen3-8B2026.02 | 55.3 | |
| FS-RAGBackbone=Qwen3-8B2026.02 | 53.1 | |
| Llama-3.1-8BBackbone=Llama-3.1-8B2026.02 | 50.5 | |
| HuatuoGPT-o1-8BBackbone=HuatuoGPT-o1-8B2026.02 | 47.9 | |
| UltraMedical-3.1-8BBackbone=UltraMedical-3.1-8B2026.02 | 41.5 |