Safety Evaluation on DirectHarm
5Harmfulness ScoreOriginal
Evaluation Results
| Method | Links | |
|---|---|---|
| OriginalModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleData2025.03 | 5 | |
| OriginalModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleQnA2025.03 | 5 | |
| OriginalModel=Llama-2-7B-Chat, Fine-tuning Dataset=TSpecLLM2025.03 | 5 | |
| SafeMERGEModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleQnA2025.03 | 5.9 | |
| SafeMERGEModel=Llama-2-7B-Chat, Fine-tuning Dataset=TSpecLLM2025.03 | 6.3 | |
| RESTA-InstructModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleQnA2025.03 | 6.4 | |
| SafeInstructModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleQnA2025.03 | 6.8 | |
| RESTAModel=Llama-2-7B-Chat, Fine-tuning Dataset=TSpecLLM2025.03 | 6.8 | |
| SafeMERGEModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleData2025.03 | 6.9 | |
| SafeLoRAModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleQnA2025.03 | 7.5 | |
| SafeInstructModel=Llama-2-7B-Chat, Fine-tuning Dataset=TSpecLLM2025.03 | 7.5 | |
| RESTAModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleQnA2025.03 | 7.7 | |
| RESTA-InstructModel=Llama-2-7B-Chat, Fine-tuning Dataset=TSpecLLM2025.03 | 7.9 | |
| SafeMERGEModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 8.2 | |
| SafeLoRAModel=Llama-2-7B-Chat, Fine-tuning Dataset=TSpecLLM2025.03 | 8.2 | |
| SafeInstructModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleData2025.03 | 8.5 | |
| SafeMERGEModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 8.5 | |
| RESTAModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleData2025.03 | 8.7 | |
| SafeMERGEModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 8.7 | |
| RESTAModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 8.8 | |
| RESTAModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 9.4 | |
| RESTA-InstructModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleData2025.03 | 9.5 | |
| SafeInstructModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 9.5 | |
| SafeInstructModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 9.8 | |
| SafeInstructModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 10.1 | |
| SafeMERGEModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 10.1 | |
| SafeLoRAModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleData2025.03 | 10.2 | |
| RESTA-InstructModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 10.8 | |
| SafeMERGEModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 10.9 | |
| SafeLoRAModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 11 | |
| RESTA-InstructModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 11.2 | |
| OriginalModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 11.3 | |
| OriginalModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 11.3 | |
| OriginalModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 11.3 | |
| SafeLoRAModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 11.4 | |
| SafeMERGEModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 11.5 | |
| RESTAModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 11.7 | |
| SafeMERGEModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 11.8 | |
| SafeMERGEModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 12.1 | |
| Fine-tunedModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleQnA2025.03 | 12.3 | |
| SafeMERGEModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 12.6 | |
| SafeLoRAModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 12.7 | |
| Fine-tunedModel=Llama-2-7B-Chat, Fine-tuning Dataset=TSpecLLM2025.03 | 12.9 | |
| RESTA-InstructModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 13.6 | |
| SafeInstructModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 13.7 | |
| SafeInstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 14.1 | |
| OriginalModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 14.2 | |
| OriginalModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 14.2 | |
| OriginalModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 14.2 | |
| SafeInstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 14.4 | |
| SafeInstructModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 14.8 | |
| SafeInstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 15.1 | |
| SafeInstructModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 15.7 | |
| RESTA-InstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 16.3 | |
| RESTA-InstructModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 16.8 | |
| RESTAModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 17 | |
| RESTA-InstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 17.1 | |
| SafeLoRAModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 17.2 | |
| SafeLoRAModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 17.4 | |
| Fine-tunedModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 17.5 | |
| RESTA-InstructModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 17.6 | |
| RESTA-InstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 17.6 | |
| RESTAModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 17.8 | |
| RESTAModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 18 | |
| OriginalModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 18.2 | |
| Fine-tunedModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 18.2 | |
| OriginalModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 18.2 | |
| OriginalModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 18.2 | |
| SafeLoRAModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 18.3 | |
| RESTA-InstructModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 18.4 | |
| RESTAModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 19 | |
| RESTAModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 19.1 | |
| RESTAModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 19.1 | |
| SafeLoRAModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 19.2 | |
| SafeLoRAModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 19.7 | |
| Fine-tunedModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 21.2 | |
| SafeLoRAModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 21.8 | |
| Fine-tunedModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 22.5 | |
| Fine-tunedModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 26.3 | |
| Fine-tunedModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 26.6 | |
| Fine-tunedModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 27 | |
| Fine-tunedModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 29.7 | |
| Fine-tunedModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 34.5 | |
| Fine-tunedModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleData2025.03 | 36.7 |