Question Answering on MedicalQA (test)
52.9ROUGEP2S
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| P2STraining Paradigm=Proposed Framework2026.01 | 52.9 | 24.33 | 22.67 | 25.85 | 24.28 | |
| General ReasonerTraining Paradigm=Fine-tuning and RL methods2026.01 | 51.57 | 19.18 | 17.2 | 27.45 | 21.28 | |
| VeriFreeTraining Paradigm=RLPR methods2026.01 | 51.46 | 21.98 | 21.68 | 22.85 | 22.17 | |
| RLPRTraining Paradigm=RLPR methods2026.01 | 51.14 | 21.16 | 20.75 | 26.92 | 22.94 | |
| Full-SftTraining Paradigm=Fine-tuning and RL methods2026.01 | 50.92 | 20.8 | 20.04 | 22.65 | 21.28 | |
| SFT+GRPOTraining Paradigm=Fine-tuning and RL methods2026.01 | 50.57 | 23.33 | 20 | 23.8 | 22.38 | |
| DROTraining Paradigm=RLPR methods2026.01 | 50.52 | 20.11 | 19.2 | 23.5 | 20.94 | |
| GRPOTraining Paradigm=Fine-tuning and RL methods2026.01 | 46.21 | 17.67 | 21 | 25.5 | 21.39 | |
| GRPO+SFT-lossTraining Paradigm=Fine-tuning and RL methods2026.01 | 45.79 | 21 | 20.4 | 24.15 | 21.85 | |
| Qwen2.5-1.5B-InstructTraining Paradigm=Base Model2026.01 | 40.3 | 19.2 | 19.2 | 27 | 21.8 | |
| COTTraining Paradigm=Prompt-Based2026.01 | 40.09 | 20.4 | 21.6 | 26.6 | 22.87 | |
| Self-ConsistencyTraining Paradigm=Prompt-Based2026.01 | 38.76 | 14.1 | 17.13 | 23.75 | 18.33 |