Medical Question Answering on GPQA (test)
49.6AccuracyOurs
Evaluation Results
| Method | Links | |
|---|---|---|
| OursBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Ours, Number of Selected Examples=20002026.06 | 49.6 | |
| Embedding DiversityBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Embedding Diversity, Number of Selected Examples=20002026.06 | 49.5 | |
| LearnabilityBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Learnability, Number of Selected Examples=20002026.06 | 48.5 | |
| Middle PerplexityBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Middle Perplexity, Number of Selected Examples=20002026.06 | 47.8 | |
| RandomBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=Random, Number of Selected Examples=20002026.06 | 46.5 | |
| S2LBase Model=Qwen2.5-7B-Instruct, Fine-tuning Dataset Source=m23k, Selection Method=S2L, Number of Selected Examples=20002026.06 | 46 |