Medical on MedCalc
57.4AccuracySFT
Evaluation Results
| Method | Links | |
|---|---|---|
| SFTBackbone=Qwen2.5-3B-Instruct2026.05 | 57.4 | |
| Anchored LearningBackbone=Llama-3.2-3B-Instruct2026.05 | 56.4 | |
| Anchored LearningBackbone=Qwen2.5-3B-Instruct2026.05 | 56.3 | |
| SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 54.7 | |
| Low-SFTBackbone=Qwen2.5-3B-Instruct2026.05 | 54.4 | |
| Low-SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 51.3 | |
| Anchored LearningBackbone=Qwen2.5-3B-Instruct, Incremental Learning Stage=Stage 2: iGSM -> MedCalc2026.05 | 51.2 | |
| Low-SFTBackbone=Qwen2.5-3B-Instruct, Incremental Learning Stage=Stage 2: iGSM -> MedCalc2026.05 | 50.5 | |
| KL-SFTBackbone=Qwen2.5-3B-Instruct2026.05 | 35.6 | |
| KL-SFT 0.2Backbone=Llama-3.2-3B-Instruct2026.05 | 35.6 | |
| Anchored LearningBackbone=Qwen2.5-3B-Instruct, Incremental Learning Stage=Stage 3: iGSM -> MedCalc -> IFEval2026.05 | 29.7 | |
| Iter-SFTBackbone=Qwen2.5-3B-Instruct2026.05 | 29 | |
| Iter-SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 23.8 | |
| Self-sftBackbone=Qwen2.5-3B-Instruct2026.05 | 21.6 | |
| Self-SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 17.3 | |
| Low-SFTBackbone=Qwen2.5-3B-Instruct, Incremental Learning Stage=Stage 3: iGSM -> MedCalc -> IFEval2026.05 | 15.7 | |
| STMBackbone=Qwen2.5-3B-Instruct2026.05 | 14.7 | |
| DFTBackbone=Qwen2.5-3B-Instruct2026.05 | 14.5 | |
| DFTBackbone=Llama-3.2-3B-Instruct2026.05 | 14.5 | |
| BaseBackbone=Qwen2.5-3B-Instruct2026.05 | 13.3 | |
| BaseBackbone=Qwen2.5-3B-Instruct, Incremental Learning Stage=Pre-trained2026.05 | 13.3 | |
| Low-SFTBackbone=Qwen2.5-3B-Instruct, Incremental Learning Stage=Stage 1: iGSM2026.05 | 10 | |
| STMBackbone=Llama-3.2-3B-Instruct2026.05 | 8.5 | |
| BaseBackbone=Llama-3.2-3B-Instruct2026.05 | 7.8 | |
| Anchored LearningBackbone=Qwen2.5-3B-Instruct, Incremental Learning Stage=Stage 1: iGSM2026.05 | 7.3 |