ResearchBenchmarksLanguage Model Alignment on Safe RLHFFollow80.7Win Rate (Helpfulness)PbCRL72.17274.38676.678.814Mar 24, 2026Evaluation ResultsMethodMethodLinksWin Rate (Helpfulness)Win Rate (Harmlessness)RewardCostPbCRLBase Model=Llama-3.2-1...Base Model=Llama-3.2-1B, Judge=Gemini 2.5 Flash2026.0380.782.14.223.03Safe RLHFBase Model=Llama-3.2-1...Base Model=Llama-3.2-1B, Judge=Gemini 2.5 Flash2026.0379.476.54.052.97PPOBase Model=Llama-3.2-1...Base Model=Llama-3.2-1B, Judge=Gemini 2.5 Flash2026.0372.560.72.78-0.57