Safe Completion on Self-harm Queries
95.1Preference ScoreReSA-SFT
Evaluation Results
| Method | Links | |
|---|---|---|
| ReSA-SFTBase Model=Qwen2.5-72b-Instruct, Comparison Baseline=All Refusal, Evaluator=Llama3.1-8B-Instruct2025.09 | 95.1 | |
| ReSA-SFTBase Model=Llama3.3-70b-Instruct, Comparison Baseline=All Refusal, Evaluator=Llama3.1-8B-Instruct2025.09 | 94.44 | |
| ReSA-SFTBase Model=Llama3.3-70b-Instruct, Comparison Baseline=All Refusal, Evaluator=Qwen2.5-7B-Instruct2025.09 | 90.52 | |
| ReSA-SFTBase Model=Qwen2.5-72b-Instruct, Comparison Baseline=All Refusal, Evaluator=Qwen2.5-7B-Instruct2025.09 | 87.58 | |
| ReSA-SFTBase Model=Llama3.3-70b-Instruct, Comparison Baseline=Post-hoc (LlamaGuard), Evaluator=Llama3.1-8B-Instruct2025.09 | 83.33 | |
| ReSA-SFTBase Model=Qwen2.5-72b-Instruct, Comparison Baseline=Post-hoc (LlamaGuard), Evaluator=Llama3.1-8B-Instruct2025.09 | 82.03 | |
| ReSA-SFTBase Model=Qwen2.5-72b-Instruct, Comparison Baseline=Post-hoc (LlamaGuard), Evaluator=Qwen2.5-7B-Instruct2025.09 | 70.26 | |
| ReSA-SFTBase Model=Llama3.3-70b-Instruct, Comparison Baseline=Post-hoc (LlamaGuard), Evaluator=Qwen2.5-7B-Instruct2025.09 | 70.26 |