Chat Quality Evaluation on MT-Bench (test)
7.1MT-Bench Mean ScoreENPO₁/₈
Evaluation Results
| Method | Links | |
|---|---|---|
| ENPO₁/₈Iteration=3, 1/η=0.9375 · 10⁻³, Judge model=gpt-4o-mini2026.05 | 7.1 | |
| ENPO₁/₂Iteration=3, 1/η=3.75 · 10⁻³, Judge model=gpt-4o-mini2026.05 | 7.07 | |
| ENPO₁/₄Iteration=3, 1/η=1.875 · 10⁻³, Judge model=gpt-4o-mini2026.05 | 7.03 | |
| INPO₁/₂Iteration=3, 1/η=3.75 · 10⁻³, Judge model=gpt-4o-mini2026.05 | 7 | |
| INPOIteration=3, 1/η=7.5 · 10⁻³, Judge model=gpt-4o-mini2026.05 | 6.94 | |
| XPOIteration=3, Judge model=gpt-4o-mini2026.05 | 6.91 | |
| Base Llama-3-8B-InstructIteration=3, Judge model=gpt-4o-mini2026.05 | 6.64 | |
| INPO₁/₄Iteration=3, 1/η=1.875 · 10⁻³, Judge model=gpt-4o-mini2026.05 | 6.55 | |
| INPO₁/₈Iteration=3, 1/η=0.9375 · 10⁻³, Judge model=gpt-4o-mini2026.05 | 5.61 |