Harmfulness Evaluation on DirectHarm
5Harmfulness ScoreOriginal
Evaluation Results
| Method | Links | |
|---|---|---|
| OriginalModel=Llama-2-7B-Chat, Fine-tuning Context=GSM8K2025.03 | 5 | |
| OriginalModel=Llama-2-7B-Chat, Fine-tuning Context=PubMedQA2025.03 | 5 | |
| RESTAModel=Llama-2-7B-Chat, Fine-tuning Context=PubMedQA2025.03 | 5.8 | |
| SafeInstructModel=Llama-2-7B-Chat, Fine-tuning Context=GSM8K2025.03 | 7.5 | |
| RESTAModel=Llama-2-7B-Chat, Fine-tuning Context=GSM8K2025.03 | 7.5 | |
| SafeMERGEModel=Llama-2-7B-Chat, Fine-tuning Context=GSM8K2025.03 | 7.5 | |
| RESTA-InstructModel=Llama-2-7B-Chat, Fine-tuning Context=PubMedQA2025.03 | 8.1 | |
| SafeMERGEModel=Llama-2-7B-Chat, Fine-tuning Context=PubMedQA2025.03 | 8.1 | |
| SafeMERGEModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 8.2 | |
| SafeMERGEModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 8.5 | |
| SafeMERGEModel=Llama-3.1-8B-Instruct, Fine-tuning Context=GSM8K2025.03 | 8.8 | |
| SafeMERGEModel=Llama-3.1-8B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 9.1 | |
| RESTA-InstructModel=Llama-2-7B-Chat, Fine-tuning Context=GSM8K2025.03 | 9.5 | |
| SafeMERGEModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 10.1 | |
| SafeLoRAModel=Llama-2-7B-Chat, Fine-tuning Context=GSM8K2025.03 | 10.2 | |
| RESTAModel=Llama-3.1-8B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 10.3 | |
| SafeLoRAModel=Llama-2-7B-Chat, Fine-tuning Context=PubMedQA2025.03 | 10.7 | |
| SafeMERGEModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 11.1 | |
| OriginalModel=Llama-3.1-8B-Instruct, Fine-tuning Context=GSM8K2025.03 | 11.3 | |
| OriginalModel=Llama-3.1-8B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 11.3 | |
| SafeInstructModel=Llama-3.1-8B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 11.8 | |
| RESTAModel=Llama-3.1-8B-Instruct, Fine-tuning Context=GSM8K2025.03 | 11.9 | |
| SafeInstructModel=Llama-2-7B-Chat, Fine-tuning Context=PubMedQA2025.03 | 12.2 | |
| Fine-tunedModel=Llama-2-7B-Chat, Fine-tuning Context=PubMedQA2025.03 | 12.5 | |
| SafeInstructModel=Llama-3.1-8B-Instruct, Fine-tuning Context=GSM8K2025.03 | 12.5 | |
| SafeInstructModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 12.5 | |
| SafeInstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 12.5 | |
| SafeInstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 13.1 | |
| RESTA-InstructModel=Llama-3.1-8B-Instruct, Fine-tuning Context=GSM8K2025.03 | 13.5 | |
| SafeInstructModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 13.7 | |
| RESTA-InstructModel=Llama-3.1-8B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 14.2 | |
| OriginalModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 14.2 | |
| OriginalModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 14.2 | |
| RESTA-InstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 14.9 | |
| SafeLoRAModel=Llama-3.1-8B-Instruct, Fine-tuning Context=GSM8K2025.03 | 15.1 | |
| RESTAModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 15.7 | |
| SafeLoRAModel=Llama-3.1-8B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 16.7 | |
| SafeLoRAModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 17.1 | |
| RESTA-InstructModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 17.4 | |
| RESTA-InstructModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 17.6 | |
| RESTA-InstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 17.7 | |
| OriginalModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 18.2 | |
| OriginalModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 18.2 | |
| RESTAModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 18.3 | |
| RESTAModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 18.5 | |
| RESTAModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 18.8 | |
| SafeLoRAModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 19.4 | |
| SafeLoRAModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 19.5 | |
| Fine-tunedModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 20.2 | |
| Fine-tunedModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 22.1 | |
| SafeLoRAModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 22.3 | |
| Fine-tunedModel=Llama-3.1-8B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 23.5 | |
| Fine-tunedModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 25.3 | |
| Fine-tunedModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 26 | |
| Fine-tunedModel=Llama-2-7B-Chat, Fine-tuning Context=GSM8K2025.03 | 27.8 | |
| Fine-tunedModel=Llama-3.1-8B-Instruct, Fine-tuning Context=GSM8K2025.03 | 28.3 |