Safety Evaluation on HarmBench and SafeChain (Safety-Tuned)
2.41Safety-Tuned ScoreLED
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LEDBackbone=Qwen2.5-7B2026.01 | 2.41 | 0.36 | 4.59 | |
| Task ArithmeticBackbone=Qwen2.5-7B2026.01 | 2.31 | 0.4 | 4.66 | |
| LinearBackbone=Qwen2.5-7B2026.01 | 2.08 | 0.31 | 4.57 | |
| TiesBackbone=Qwen2.5-7B2026.01 | 1.95 | 0.02 | 4.86 | |
| ReasoningBackbone=Qwen2.5-7B2026.01 | 1.91 | 0.46 | 4.61 | |
| FuseLLMMerging Method=FuseLLM2026.01 | 1.73 | 4.46 | 4.46 | |
| ReasoningModel Family=Qwen2.5-32B, Role=Source Model (QwQ-32B-Preview)2026.01 | 1.72 | 4.64 | 4.64 | |
| LEDMerging Method=LED2026.01 | 1.57 | 4.6 | 4.6 | |
| DAREBackbone=Qwen2.5-7B2026.01 | 1.54 | 0 | 4.86 | |
| Task ArithmeticMerging Method=Task Arithmetic2026.01 | 1.4 | 4.79 | 4.79 | |
| TIESMerging Method=TIES2026.01 | 1.32 | 4.81 | 4.81 | |
| LinearMerging Method=Linear2026.01 | 1.28 | 4.59 | 4.59 | |
| DAREMerging Method=DARE2026.01 | 1.28 | 4.6 | 4.6 | |
| SafetyModel Family=Qwen2.5-32B, Role=Source Model (Safety-Instruct)2026.01 | 1.2 | 4.83 | 4.83 | |
| ReasonAnyMerging Method=ReasonAny2026.01 | 1.2 | 4.8 | 4.8 | |
| ReasonAnyBackbone=Qwen2.5-7B2026.01 | 1.19 | 0.08 | 4.86 | |
| SafetyBackbone=Qwen2.5-7B2026.01 | 1.18 | 0.08 | 4.9 | |
| FuseLLMBackbone=Qwen2.5-7B2026.01 | 0.87 | 0.01 | 4.54 |