Safety Evaluation on HexPhi
2HarmfulnessOriginal
Evaluation Results
| Method | Links | |
|---|---|---|
| OriginalModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleData2025.03 | 2 | |
| OriginalModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleQnA2025.03 | 2 | |
| OriginalModel=Llama-2-7B-Chat, Fine-tuning Dataset=TSpecLLM2025.03 | 2 | |
| OriginalModel=Llama-2-7B-Chat, Fine-tuning Context=GSM8K2025.03 | 2 | |
| OriginalModel=Llama-2-7B-Chat, Fine-tuning Context=PubMedQA2025.03 | 2 | |
| SafeMERGEModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleQnA2025.03 | 3.8 | |
| SafeInstructModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleQnA2025.03 | 4.2 | |
| RESTAModel=Llama-2-7B-Chat, Fine-tuning Context=PubMedQA2025.03 | 4.2 | |
| RESTAModel=Llama-2-7B-Chat, Fine-tuning Context=GSM8K2025.03 | 4.3 | |
| SafeMERGEModel=Llama-2-7B-Chat, Fine-tuning Context=PubMedQA2025.03 | 4.3 | |
| RESTA-InstructModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleQnA2025.03 | 4.5 | |
| SafeMERGEModel=Llama-2-7B-Chat, Fine-tuning Dataset=TSpecLLM2025.03 | 4.5 | |
| RESTAModel=Llama-2-7B-Chat, Fine-tuning Dataset=TSpecLLM2025.03 | 4.7 | |
| SafeInstructModel=Llama-2-7B-Chat, Fine-tuning Dataset=TSpecLLM2025.03 | 4.9 | |
| SafeLoRAModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleQnA2025.03 | 5 | |
| SafeMERGEModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleData2025.03 | 5.1 | |
| SafeMERGEModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 5.1 | |
| RESTA-InstructModel=Llama-2-7B-Chat, Fine-tuning Context=PubMedQA2025.03 | 5.3 | |
| RESTA-InstructModel=Llama-2-7B-Chat, Fine-tuning Dataset=TSpecLLM2025.03 | 5.4 | |
| RESTAModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleQnA2025.03 | 5.6 | |
| RESTAModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 5.7 | |
| SafeMERGEModel=Llama-2-7B-Chat, Fine-tuning Context=GSM8K2025.03 | 5.7 | |
| SafeMERGEModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 5.8 | |
| SafeInstructModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 5.9 | |
| SafeLoRAModel=Llama-2-7B-Chat, Fine-tuning Context=PubMedQA2025.03 | 5.9 | |
| SafeInstructModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 5.9 | |
| SafeMERGEModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 5.9 | |
| RESTAModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 6 | |
| RESTAModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleData2025.03 | 6.1 | |
| SafeMERGEModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 6.1 | |
| SafeInstructModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 6.2 | |
| SafeInstructModel=Llama-2-7B-Chat, Fine-tuning Context=GSM8K2025.03 | 6.2 | |
| Fine-tunedModel=Llama-2-7B-Chat, Fine-tuning Context=PubMedQA2025.03 | 6.2 | |
| SafeInstructModel=Llama-2-7B-Chat, Fine-tuning Context=PubMedQA2025.03 | 6.3 | |
| SafeMERGEModel=Llama-3.1-8B-Instruct, Fine-tuning Context=GSM8K2025.03 | 6.3 | |
| SafeLoRAModel=Llama-2-7B-Chat, Fine-tuning Dataset=TSpecLLM2025.03 | 6.4 | |
| RESTA-InstructModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 6.6 | |
| RESTA-InstructModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleData2025.03 | 6.7 | |
| RESTA-InstructModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 6.8 | |
| RESTA-InstructModel=Llama-2-7B-Chat, Fine-tuning Context=GSM8K2025.03 | 6.8 | |
| SafeMERGEModel=Llama-3.1-8B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 6.8 | |
| RESTAModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 6.9 | |
| SafeLoRAModel=Llama-2-7B-Chat, Fine-tuning Context=GSM8K2025.03 | 6.9 | |
| RESTAModel=Llama-3.1-8B-Instruct, Fine-tuning Context=GSM8K2025.03 | 6.9 | |
| SafeLoRAModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 7.1 | |
| SafeLoRAModel=Llama-3.1-8B-Instruct, Fine-tuning Context=GSM8K2025.03 | 7.1 | |
| RESTAModel=Llama-3.1-8B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 7.1 | |
| SafeInstructModel=Llama-3.1-8B-Instruct, Fine-tuning Context=GSM8K2025.03 | 7.2 | |
| RESTA-InstructModel=Llama-3.1-8B-Instruct, Fine-tuning Context=GSM8K2025.03 | 7.2 | |
| SafeInstructModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleData2025.03 | 7.3 | |
| Fine-tunedModel=Llama-2-7B-Chat, Fine-tuning Dataset=TSpecLLM2025.03 | 7.3 | |
| SafeLoRAModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 7.3 | |
| RESTA-InstructModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 7.4 | |
| Fine-tunedModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleQnA2025.03 | 7.5 | |
| SafeMERGEModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 7.5 | |
| SafeMERGEModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 7.5 | |
| OriginalModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 7.9 | |
| OriginalModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 7.9 | |
| OriginalModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 7.9 | |
| OriginalModel=Llama-3.1-8B-Instruct, Fine-tuning Context=GSM8K2025.03 | 7.9 | |
| OriginalModel=Llama-3.1-8B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 7.9 | |
| SafeInstructModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 8.1 | |
| SafeLoRAModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 8.4 | |
| SafeMERGEModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 8.4 | |
| SafeLoRAModel=Llama-2-7B-Chat, Fine-tuning Dataset=TeleData2025.03 | 8.5 | |
| SafeInstructModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 8.5 | |
| SafeMERGEModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 8.6 | |
| RESTA-InstructModel=Llama-3.1-8B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 8.7 | |
| SafeMERGEModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 8.7 | |
| SafeInstructModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 9.5 | |
| SafeInstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 9.5 | |
| SafeMERGEModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 9.6 | |
| SafeLoRAModel=Llama-3.1-8B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 9.6 | |
| SafeInstructModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 9.7 | |
| SafeInstructModel=Llama-3.1-8B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 9.7 | |
| SafeMERGEModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 9.9 | |
| SafeInstructModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 10.1 | |
| SafeMERGEModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 10.3 | |
| SafeMERGEModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 10.4 | |
| Fine-tunedModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 10.7 | |
| SafeLoRAModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 11.3 | |
| SafeInstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 11.3 | |
| OriginalModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 11.5 | |
| OriginalModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 11.5 | |
| OriginalModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 11.5 | |
| OriginalModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 11.5 | |
| OriginalModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 11.5 | |
| Fine-tunedModel=Llama-3.1-8B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 11.8 | |
| RESTA-InstructModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 11.9 | |
| RESTA-InstructModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 12.1 | |
| Fine-tunedModel=Llama-3.1-8B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 12.2 | |
| SafeLoRAModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 12.3 | |
| RESTA-InstructModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 12.4 | |
| SafeLoRAModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 12.8 | |
| SafeInstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 12.8 | |
| SafeInstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 12.9 | |
| RESTAModel=Qwen-2-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 13.1 | |
| OriginalModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleData2025.03 | 13.2 | |
| OriginalModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TeleQnA2025.03 | 13.2 | |
| OriginalModel=Qwen-2.5-7B-Instruct, Fine-tuning Dataset=TSpecLLM2025.03 | 13.2 |