LLM Alignment on UltraFeedback pool (test)
51.8Instruction Following Win RateMGDA-DECOUPLED
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| MGDA-DECOUPLEDBase Model=Gemma-2-2b-it, LLM-as-a-judge=GPT-4o2026.04 | 51.8 | 3 | 45.2 | 29.2 | 47.2 | 23.6 | 56.5 | 6.3 | 37.1 | 51.1 | 10 | 38.9 | — | |
| UNIFORMBase Model=Gemma-2-2b-it, LLM-as-a-judge=GPT-4o2026.04 | 51.4 | 3.1 | 45.5 | 28.9 | 47.4 | 23.7 | 56.3 | 6.4 | 37.2 | 51.1 | 9.7 | 39.2 | — | |
| GROUPDROBase Model=Gemma-2-2b-it, LLM-as-a-judge=GPT-4o2026.04 | 51.2 | 2.9 | 45.9 | 29.4 | 47.5 | 23.1 | 56.2 | 6.5 | 37.3 | 50.7 | 10 | 39.3 | — | |
| REFERENCEBase Model=Gemma-2-2b-it, LLM-as-a-judge=GPT-4o2026.04 | 51 | 2.7 | 46.3 | 29 | 47.1 | 23.9 | 55.6 | 6.5 | 37.9 | 50.8 | 9.7 | 39.5 | — | |
| MGDA-NORMALISEDBase Model=Gemma-2-2b-it, LLM-as-a-judge=GPT-4o2026.04 | 50.9 | 2.9 | 46.2 | 29.1 | 46.8 | 24 | 55.8 | 6.3 | 37.9 | 50.5 | 10 | 39.5 | — | |
| CDPOBase Model=Gemma-2-2b-it, LLM-as-a-judge=GPT-4o2026.04 | 50.9 | 2.9 | 46.2 | 29.2 | 47.6 | 23.2 | 55.2 | 6.5 | 38.3 | 50.5 | 10.1 | 39.4 | — |