ResearchBenchmarksSafety Alignment on AIR-Bench 64 harmful promptsFollow1.13HarmSafeRLVR0.97682.01093.0454.0791Oct 17, 2025Evaluation ResultsMethodMethodLinksHarmASR (%)UtilityAccuracy (%)SafeRLVRModel=DeepSeek-R1, Bas...Model=DeepSeek-R1, Base Method=Base2025.101.130.366.3973.73BaseModel=DeepSeek-R1Model=DeepSeek-R12025.102.9829.057.2274.33SafeRLVRModel=Llama3, Base Met...Model=Llama3, Base Method=HarmRLVR2025.104.6796.482.7352.9HarmRLVRModel=Llama3Model=Llama32025.104.9696.867.7380.93