LLM Alignment on UltraFeedback 200K samples (test)
81.9Win RateHard-Pair-GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Hard-Pair-GRPOBase Model=LLaMA-2-7B-Chat2026.05 | 81.9 | |
| ORPOBase Model=LLaMA-2-7B-Chat2026.05 | 79.1 | |
| DPOBase Model=LLaMA-2-7B-Chat2026.05 | 78.5 | |
| Soft-Pair-GRPOBase Model=LLaMA-2-7B-Chat2026.05 | 77.8 | |
| Standard GRPOBase Model=LLaMA-2-7B-Chat2026.05 | 76.3 |