Chatbot Evaluation on MT-Bench Overall
8.17Human ScorerDPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| rDPOdecoding_strategy=Best-of-K2026.03 | 8.17 | 0.69 | 6.79 | 7.2 | |
| rDPO + DARC-ϵdecoding_strategy=DARC-ϵ2026.03 | 8.15 | 0.58 | 6.99 | 7.6 | |
| DARC-ϵ2026.03 | 8.08 | 0.55 | 6.98 | 7.62 | |
| cDPO + DARC-ϵdecoding_strategy=DARC-ϵ2026.03 | 8.03 | 0.54 | 6.95 | 7.41 | |
| DARCversion=base2026.03 | 7.84 | 0.6 | 6.64 | 7.36 | |
| DeAL2026.03 | 7.83 | 0.72 | 6.39 | 7.08 | |
| DARC-τ2026.03 | 7.83 | 0.58 | 6.67 | 7.46 | |
| Caution2026.03 | 7.82 | 0.61 | 6.6 | 7.15 | |
| cDPOdecoding_strategy=Best-of-K2026.03 | 7.8 | 0.65 | 6.5 | 7.11 | |
| BoPvariant=HedgeTune2026.03 | 7.79 | 0.63 | 6.53 | 7.12 | |
| MC-Dropout2026.03 | 7.73 | 0.64 | 6.45 | 7.19 | |
| RBoN2026.03 | 7.71 | 0.62 | 6.47 | 7.26 | |
| Basedecoding_strategy=Best-of-K2026.03 | 7.56 | 0.67 | 6.22 | 6.73 |