LLM Alignment on UltraFeedback 2023 (test)
55Win-rateMARS
Evaluation Results
| Method | Links | |
|---|---|---|
| MARSAligned Model=TinyLlama-1.1B, Comparison Baseline=WoN, Alignment Optimization=PPO-style, Judge LLM=Qwen2.5-3B-Instruct2026.02 | 55 | |
| MARSAligned Model=Llama-3.2-1B, Comparison Baseline=WoN, Alignment Optimization=PPO-style, Judge LLM=Qwen2.5-3B-Instruct2026.02 | 54 | |
| MARSAligned Model=Llama-3.2-1B, Comparison Baseline=Uniform Aug., Alignment Optimization=PPO-style, Judge LLM=Qwen2.5-3B-Instruct2026.02 | 52 | |
| MARSAligned Model=TinyLlama-1.1B, Comparison Baseline=Uniform Aug., Alignment Optimization=PPO-style, Judge LLM=Qwen2.5-3B-Instruct2026.02 | 51 |