Medical Question Answering on LLMMed-Eval Medical
79.61ScoreGemini-2.5-pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-proBackbone=Proprietary2026.05 | 79.61 | |
| External Evolving-RLBackbone=Qwen3-14B2026.05 | 73.76 | |
| EvoRubricBackbone=Qwen3-14B2026.05 | 73.46 | |
| GPT-4oBackbone=Proprietary2026.05 | 72.71 | |
| Static Rubric-RLBackbone=Qwen3-14B2026.05 | 72.36 | |
| Base ModelBackbone=Qwen3-14B2026.05 | 71.36 | |
| EvoRubricBackbone=Qwen3-8B2026.05 | 70.76 | |
| Static Rubric-RLBackbone=Qwen3-8B2026.05 | 69.26 | |
| Base ModelBackbone=Qwen3-8B2026.05 | 68.06 | |
| External Evolving-RLBackbone=Qwen3-8B2026.05 | 67.31 |