Medical Question Answering on Medec
69.2AccuracyBFRS
Evaluation Results
| Method | Links | |
|---|---|---|
| BFRSModel=o3 Mini2025.11 | 69.2 | |
| HELM BaselineModel=o3 Mini2025.11 | 68.7 | |
| Zero-Shot PredictModel=o3 Mini2025.11 | 68.3 | |
| MIPROv2Model=o3 Mini2025.11 | 68.3 | |
| Zero-Shot CoTModel=o3 Mini2025.11 | 68.2 | |
| HELM BaselineModel=Claude 3.7 Sonnet2025.11 | 62.8 | |
| MIPROv2Model=Claude 3.7 Sonnet2025.11 | 62.5 | |
| MIPROv2Model=Llama 3.3 70B2025.11 | 62 | |
| Zero-Shot CoTModel=Claude 3.7 Sonnet2025.11 | 61.8 | |
| MIPROv2Model=Gemini 2.0 Flash2025.11 | 60.8 | |
| BFRSModel=Claude 3.7 Sonnet2025.11 | 60.5 | |
| Zero-Shot CoTModel=Llama 3.3 70B2025.11 | 60.1 | |
| BFRSModel=Llama 3.3 70B2025.11 | 60.1 | |
| MIPROv2Model=GPT 4o2025.11 | 59.8 | |
| HELM BaselineModel=Gemini 2.0 Flash2025.11 | 59.6 | |
| Zero-Shot CoTModel=Gemini 2.0 Flash2025.11 | 59.5 | |
| Zero-Shot CoTModel=GPT 4o2025.11 | 59.5 | |
| BFRSModel=GPT 4o2025.11 | 59.5 | |
| Zero-Shot PredictModel=Gemini 2.0 Flash2025.11 | 59.3 | |
| BFRSModel=Gemini 2.0 Flash2025.11 | 59.1 | |
| Zero-Shot PredictModel=Claude 3.7 Sonnet2025.11 | 58.3 | |
| HELM BaselineModel=GPT 4o2025.11 | 58 | |
| Zero-Shot PredictModel=GPT 4o2025.11 | 57.3 | |
| MIPROv2Model=Qwen3 4B2025.11 | 56.6 | |
| BFRSModel=Qwen3 4B2025.11 | 56.4 | |
| Zero-Shot PredictModel=Llama 3.3 70B2025.11 | 53.6 | |
| Zero-Shot CoTModel=Qwen3 4B2025.11 | 53.6 | |
| HELM BaselineModel=Llama 3.3 70B2025.11 | 52.9 | |
| Zero-Shot PredictModel=Qwen3 4B2025.11 | 52.3 | |
| HELM BaselineModel=Qwen3 4B2025.11 | 52.1 |