Question Answering on MedXpertQA (test)
44.5AccuracyGPT-5-mini
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-5-miniBackbone Model=GPT-5-mini, Confidence Estimation Strategy=Base2025.11 | 44.5 | — | — | — | |
| GPT-5-mini + Verbalized Conf.Backbone Model=GPT-5-mini, Confidence Estimation Strategy=Verbalized Conf.2025.11 | 44.5 | 0.603 | 0.419 | 0.425 | |
| GPT-5-mini + Verbalized Top-kBackbone Model=GPT-5-mini, Confidence Estimation Strategy=Verbalized Top-k2025.11 | 43.7 | 0.597 | 0.358 | 0.345 | |
| GPT-5-mini + Verbalized Probability DistributionBackbone Model=GPT-5-mini, Confidence Estimation Strategy=Verbalized Probability Distribution2025.11 | 43.3 | 0.624 | 0.28 | 0.211 | |
| Qwen3-4B-Thinking + Verbalized Top-kBackbone Model=Qwen3-4B-Thinking, Confidence Estimation Strategy=Verbalized Top-k2025.11 | 17.6 | 0.513 | 0.636 | 0.698 | |
| Qwen3-4B-Thinking + Verbalized Conf.Backbone Model=Qwen3-4B-Thinking, Confidence Estimation Strategy=Verbalized Conf.2025.11 | 17 | 0.511 | 0.713 | 0.755 | |
| Qwen3-4B-ThinkingBackbone Model=Qwen3-4B-Thinking, Confidence Estimation Strategy=Base2025.11 | 16.8 | — | — | — | |
| Qwen3-4B-Thinking + Verbalized Probability DistributionBackbone Model=Qwen3-4B-Thinking, Confidence Estimation Strategy=Verbalized Probability Distribution2025.11 | 16.8 | 0.539 | 0.497 | 0.584 |