Multi-task Evaluation on General and Medical Aggregation
51.8Overall AverageAnchored Learning
Evaluation Results
| Method | Links | |
|---|---|---|
| Anchored LearningBackbone=Qwen2.5-3B-Instruct2026.05 | 51.8 | |
| BaseBackbone=Qwen2.5-3B-Instruct2026.05 | 50.8 | |
| Low-SFTBackbone=Qwen2.5-3B-Instruct2026.05 | 48.8 | |
| Self-sftBackbone=Qwen2.5-3B-Instruct2026.05 | 48.3 | |
| Iter-SFTBackbone=Qwen2.5-3B-Instruct2026.05 | 48.3 | |
| STMBackbone=Qwen2.5-3B-Instruct2026.05 | 42.5 | |
| DFTBackbone=Qwen2.5-3B-Instruct2026.05 | 40.1 | |
| KL-SFTBackbone=Qwen2.5-3B-Instruct2026.05 | 12.9 | |
| SFTBackbone=Qwen2.5-3B-Instruct2026.05 | 10.4 |