Distractor Generation on MedQA
21.05P@1GPT-3(few-shot-COT-k-NN)
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| GPT-3(few-shot-COT-k-NN)Approach=Prompting2026.04 | 21.05 | 5.26 | 14.66 | 27.39 | 30.34 | 0 | 0 | |
| GPT-3(few-shot-k-NN)Approach=Prompting2026.04 | 20.9 | 5.22 | 15.08 | 27.44 | 30.52 | 0 | 0.08 | |
| GPT-3(few-shot-random)Approach=Prompting2026.04 | 17.44 | 4.36 | 11.9 | 23.1 | 26.5 | 0 | 0 | |
| GPT-3(few-shot-COT-random)Approach=Prompting2026.04 | 17.2 | 4.3 | 11.74 | 22.52 | 25.63 | 0 | 0 | |
| GPT-3(zero-shot)Approach=Prompting2026.04 | 12.49 | 3.12 | 7.77 | 16.17 | 19.42 | 0 | 0 | |
| TinyLlamaApproach=Instruction Tuning2026.04 | 11.86 | 2.97 | 7.9 | 15.95 | 19.6 | 1.02 | 0.55 | |
| GPT-3-CSG-DS(clustring)Approach=CSG-DS2026.04 | 9.82 | 2.45 | 5.12 | 12.8 | 15.47 | 0.08 | 0 | |
| T5-CSG-DS(beam)Approach=CSG-DS2026.04 | 6.83 | 1.71 | 4.44 | 9.54 | 12 | 21.05 | 0.55 | |
| T5(contrast)Approach=Text2Text2026.04 | 6.83 | 1.71 | 3.5 | 8.42 | 9.57 | 9.19 | 0.31 | |
| T5(base)Approach=Text2Text2026.04 | 5.42 | 1.36 | 2.51 | 6.39 | 7.1 | 13.28 | 0.08 | |
| T5(multi-task)Approach=Text2Text2026.04 | 4.95 | 1.24 | 2.6 | 6.11 | 7 | 11.31 | 0.08 | |
| T5-CSG-DS(clustring)Approach=CSG-DS2026.04 | 4.24 | 1.06 | 1.89 | 5.85 | 7.38 | 10.05 | 0 |