Medical Question Answering on MedMCQA (val)
58.7AccuracyEmbedding Diversity
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Embedding DiversityBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Embedding Diversity, Number of Selected Examples=20002026.06 | 58.7 | — | — | — | — | |
| RandomBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Random, Number of Selected Examples=20002026.06 | 58.6 | — | — | — | — | |
| S2LBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=S2L, Number of Selected Examples=20002026.06 | 58.3 | — | — | — | — | |
| LearnabilityBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Learnability, Number of Selected Examples=20002026.06 | 58 | — | — | — | — | |
| OursBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Ours, Number of Selected Examples=20002026.06 | 58 | — | — | — | — | |
| Middle PerplexityBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Middle Perplexity, Number of Selected Examples=20002026.06 | 57.9 | — | — | — | — | |
| SD-E2Backbone=Qwen2.5-3B2026.01 | 49.64 | 95.23 | 7.21 | 490.21 | 271.1 | |
| GRPO-CFEE (C+F+EE, count)Backbone=Qwen2.5-3B2026.01 | 48.76 | 94.46 | 4.19 | 410.25 | 242.12 | |
| GRPO-CFL (C+F+L)Backbone=Qwen2.5-3B2026.01 | 46.47 | — | — | 282.99 | 198.78 | |
| Base: Qwen2.5-3BBackbone=Qwen2.5-3B2026.01 | 38.37 | — | — | 294.23 | 206.17 |