LLM Alignment on PKU-SafeRLHF 2024 (test)
0.58Win RateMARS
Evaluation Results
| Method | Links | |
|---|---|---|
| MARSAligned Model=TinyLlama-1.1B, Comparison Baseline=Uniform Aug., Alignment Optimization=PPO-style, Judge LLM=Qwen2.5-3B-Instruct2026.02 | 0.58 | |
| MARSAligned Model=TinyLlama-1.1B, Comparison Baseline=WoN, Alignment Optimization=PPO-style, Judge LLM=Qwen2.5-3B-Instruct2026.02 | 0.54 | |
| MARSAligned Model=Llama-3.2-1B, Comparison Baseline=Uniform Aug., Alignment Optimization=PPO-style, Judge LLM=Qwen2.5-3B-Instruct2026.02 | 0.53 | |
| MARSAligned Model=Llama-3.2-1B, Comparison Baseline=WoN, Alignment Optimization=PPO-style, Judge LLM=Qwen2.5-3B-Instruct2026.02 | 0.52 |