Safety Evaluation on XSTest (test)
95XSTest ScoreDPO + OGPSA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DPO + OGPSABase Model=Llama3.1-8B-Instruct, Alignment=DPO, Strategy=OGPSA2026.02 | 95 | — | — | |
| DPO + OGPSABase Model=Qwen2.5-7B-Instruct, Alignment=DPO, Strategy=OGPSA2026.02 | 94.5 | — | — | |
| SFT-DPOBase Model=Qwen2.5-7B-Instruct, Alignment=SFT-DPO, Strategy=Baseline2026.02 | 92.5 | — | — | |
| SFT-DPO + OGPSABase Model=Llama3.1-8B-Instruct, Alignment=SFT-DPO, Strategy=OGPSA2026.02 | 91.5 | — | — | |
| SFT-DPO + LoRABase Model=Qwen2.5-7B-Instruct, Alignment=SFT-DPO, Strategy=LoRA2026.02 | 90.5 | — | — | |
| SFT-DPO + OGPSABase Model=Qwen2.5-7B-Instruct, Alignment=SFT-DPO, Strategy=OGPSA2026.02 | 90.5 | — | — | |
| SFT-DPO + General DataBase Model=Llama3.1-8B-Instruct, Alignment=SFT-DPO, Strategy=General Data2026.02 | 89 | — | — | |
| Instruct BaselineBase Model=Llama3.1-8B-Instruct2026.02 | 88.5 | — | — | |
| DPO + MergedBase Model=Llama3.1-8B-Instruct, Alignment=DPO, Strategy=Merge2026.02 | 88 | — | — | |
| SFT + LoRABase Model=Qwen2.5-7B-Instruct, Alignment=SFT, Strategy=LoRA2026.02 | 88 | — | — | |
| SFT + OGPSABase Model=Qwen2.5-7B-Instruct, Alignment=SFT, Strategy=OGPSA2026.02 | 87.5 | — | — | |
| SFT-DPO + MergedBase Model=Qwen2.5-7B-Instruct, Alignment=SFT-DPO, Strategy=Merge2026.02 | 87.5 | — | — | |
| SFT-DPO + General DataBase Model=Qwen2.5-7B-Instruct, Alignment=SFT-DPO, Strategy=General Data2026.02 | 87.5 | — | — | |
| SFT-DPOBase Model=Llama3.1-8B-Instruct, Alignment=SFT-DPO, Strategy=Baseline2026.02 | 87 | — | — | |
| SFTBase Model=Qwen2.5-7B-Instruct, Alignment=SFT, Strategy=Baseline2026.02 | 87 | — | — | |
| DPOBase Model=Qwen2.5-7B-Instruct, Alignment=DPO, Strategy=Baseline2026.02 | 87 | — | — | |
| SFT + OGPSABase Model=Llama3.1-8B-Instruct, Alignment=SFT, Strategy=OGPSA2026.02 | 86 | — | — | |
| SFT + LoRABase Model=Llama3.1-8B-Instruct, Alignment=SFT, Strategy=LoRA2026.02 | 85.99 | — | — | |
| SFT + General DataBase Model=Llama3.1-8B-Instruct, Alignment=SFT, Strategy=General Data2026.02 | 85.5 | — | — | |
| DPO + LoRABase Model=Qwen2.5-7B-Instruct, Alignment=DPO, Strategy=LoRA2026.02 | 85.5 | — | — | |
| SFTBase Model=Llama3.1-8B-Instruct, Alignment=SFT, Strategy=Baseline2026.02 | 83 | — | — | |
| SFT + MergedBase Model=Qwen2.5-7B-Instruct, Alignment=SFT, Strategy=Merge2026.02 | 83 | — | — | |
| DPO + LoRABase Model=Llama3.1-8B-Instruct, Alignment=DPO, Strategy=LoRA2026.02 | 82.5 | — | — | |
| SFT-DPO + MergedBase Model=Llama3.1-8B-Instruct, Alignment=SFT-DPO, Strategy=Merge2026.02 | 82 | — | — | |
| SFT-DPO + LoRABase Model=Llama3.1-8B-Instruct, Alignment=SFT-DPO, Strategy=LoRA2026.02 | 81.5 | — | — | |
| DPOBase Model=Llama3.1-8B-Instruct, Alignment=DPO, Strategy=Baseline2026.02 | 81 | — | — | |
| DPO + MergedBase Model=Qwen2.5-7B-Instruct, Alignment=DPO, Strategy=Merge2026.02 | 79.5 | — | — | |
| SFT + MergeBase Model=Llama3.1-8B-Instruct, Alignment=SFT, Strategy=Merge2026.02 | 79 | — | — | |
| DPO + General DataBase Model=Qwen2.5-7B-Instruct, Alignment=DPO, Strategy=General Data2026.02 | 78.5 | — | — | |
| SFT + General DataBase Model=Qwen2.5-7B-Instruct, Alignment=SFT, Strategy=General Data2026.02 | 77.5 | — | — | |
| Instruct BaselineBase Model=Qwen2.5-7B-Instruct2026.02 | 65.5 | — | — | |
| DPO + General DataBase Model=Llama3.1-8B-Instruct, Alignment=DPO, Strategy=General Data2026.02 | 63 | — | — | |
| OriginBase Model=Gemma-2-9B-IT2025.02 | 20.4 | — | — | |
| TELLME NT-XentBase Model=Gemma-2-9B-IT, Loss Function=NT-Xent2025.02 | 18.4 | — | — | |
| SFTBase Model=Gemma-2-9B-IT, Training Strategy=Supervised Fine-Tuning2025.02 | 18 | — | — | |
| TELLMEBase Model=Gemma-2-9B-IT2025.02 | 14 | — | — | |
| BaseBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | — | 6 | — | |
| BlendInPair=Q→L, Intervention Rate=35.3%2026.04 | — | — | 54 | |
| BlendInPair=L→G, Intervention Rate=22.9%2026.04 | — | — | 90 | |
| BlendInPair=Q→G, Intervention Rate=35.4%2026.04 | — | — | 48 | |
| DEITABase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | — | 31.5 | — | |
| DOG-DBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | — | 5.2 | — | |
| KMeansBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | — | 8.5 | — | |
| LaserBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | — | 5.2 | — | |
| NUDGINGPair=Q→L, Intervention Rate=35.3%2026.04 | — | — | 52 | |
| NUDGINGPair=L→G, Intervention Rate=22.9%2026.04 | — | — | 90 | |
| NUDGINGPair=Q→G, Intervention Rate=35.4%2026.04 | — | — | 47 | |
| RandBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | — | 7 | — | |
| SDPOBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k, Selection Protocol=Tier-3 (Full DPO training before selection)2026.06 | — | 11.7 | — |