LLM Alignment on AlpacaEval 2.0
61.52LC Win RateGRM + LP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GRM + LPRM=+ LP, Backbone=Gemma-2-9B-it2026.04 | 61.52 | 50.04 | 1,400 | |
| FsfairX + LPRM=+ LP, Backbone=Gemma-2-9B-it2026.04 | 60.96 | 54.56 | 1,611 | |
| FsfairX + LWRRM=+ LWR, Backbone=Gemma-2-9B-it2026.04 | 60.6 | 51.32 | 1,522 | |
| GRM + LWRRM=+ LWR, Backbone=Gemma-2-9B-it2026.04 | 59.92 | 55.55 | 1,659 | |
| GRM + CIRMRM=+ CIRM, Backbone=Gemma-2-9B-it2026.04 | 59.19 | 56.62 | 1,739 | |
| INFRM=INF, Backbone=Gemma-2-9B-it2026.04 | 58.98 | 61.51 | 1,919 | |
| GRMRM=GRM, Backbone=Gemma-2-9B-it2026.04 | 58.77 | 57.24 | 1,779 | |
| FsfairX + CIRMRM=+ CIRM, Backbone=Gemma-2-9B-it2026.04 | 57.76 | 60.52 | 1,923 | |
| FsfairXRM=FsfairX, Backbone=Gemma-2-9B-it2026.04 | 55.32 | 58.56 | 1,931 | |
| HRC + DSPPOIteration=32026.05 | 52.2 | — | — | |
| HRC + DSPPOIteration=22026.05 | 51.74 | — | — | |
| BT + SPPOIteration=32026.05 | 48.79 | — | — | |
| Gemma-2-9B-itRM=-, Backbone=Gemma-2-9B-it2026.04 | 48.37 | 40.19 | 1,507 | |
| GRM + LPRM=+ LP, Backbone=Llama-3-8B-Instruct2026.04 | 44.49 | 40.18 | 1,571 | |
| FsfairX + LPRM=+ LP, Backbone=Llama-3-8B-Instruct2026.04 | 44.03 | 46.88 | 1,881 | |
| FsfairX + LWRRM=+ LWR, Backbone=Llama-3-8B-Instruct2026.04 | 43.11 | 47.07 | 1,929 | |
| HRC + DSPPOIteration=12026.05 | 42.9 | — | — | |
| GRM + CIRMRM=+ CIRM, Backbone=Llama-3-8B-Instruct2026.04 | 41.89 | 50.13 | 2,201 | |
| INFRM=INF, Backbone=Llama-3-8B-Instruct2026.04 | 40.63 | 49.61 | 2,201 | |
| GRM + LWRRM=+ LWR, Backbone=Llama-3-8B-Instruct2026.04 | 39.77 | 47.59 | 2,119 | |
| FsfairX + CIRMRM=+ CIRM, Backbone=Llama-3-8B-Instruct2026.04 | 39.49 | 51.19 | 2,345 | |
| GEMMA-2-9B-IT (BASE)Iteration=–2026.05 | 38.38 | — | — | |
| FsfairXRM=FsfairX, Backbone=Llama-3-8B-Instruct2026.04 | 37.78 | 49.74 | 2,368 | |
| GRMRM=GRM, Backbone=Llama-3-8B-Instruct2026.04 | 37.53 | 47.47 | 2,193 | |
| Llama-3-8B-InstructRM=-, Backbone=Llama-3-8B-Instruct2026.04 | 26.09 | 32.06 | 1,968 |