Chat Quality Evaluation on Arena-Hard vs gpt-4-0314 (test)
57.6Win RateENPO₁/₈
Evaluation Results
| Method | Links | |
|---|---|---|
| ENPO₁/₈Iteration=3, 1/η=0.9375 · 10⁻³, Judge model=gpt-4o-mini2026.05 | 57.6 | |
| ENPO₁/₄Iteration=3, 1/η=1.875 · 10⁻³, Judge model=gpt-4o-mini2026.05 | 53.8 | |
| INPOIteration=3, 1/η=7.5 · 10⁻³, Judge model=gpt-4o-mini2026.05 | 52 | |
| INPO₁/₂Iteration=3, 1/η=3.75 · 10⁻³, Judge model=gpt-4o-mini2026.05 | 50.9 | |
| ENPO₁/₂Iteration=3, 1/η=3.75 · 10⁻³, Judge model=gpt-4o-mini2026.05 | 50.7 | |
| XPOIteration=3, Judge model=gpt-4o-mini2026.05 | 45.7 | |
| INPO₁/₄Iteration=3, 1/η=1.875 · 10⁻³, Judge model=gpt-4o-mini2026.05 | 41.2 | |
| Base Llama-3-8B-InstructIteration=3, Judge model=gpt-4o-mini2026.05 | 36.4 | |
| INPO₁/₈Iteration=3, 1/η=0.9375 · 10⁻³, Judge model=gpt-4o-mini2026.05 | 22.4 |