Medical LLM Safety Refinement on MedSafetyBench
94.2Convergence RateDeepSeek R1
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| DeepSeek R1Refinement Framework=multi-agent evaluation loop2026.01 | 94.2 | 2.34 | 1.12 | 89.1 | 92.1 | |
| Med PaLMRefinement Framework=multi-agent evaluation loop2026.01 | 91.8 | 2.67 | 1.28 | 85.4 | 90.6 |