LLM Selection on Open LLM Leaderboard Customer Service scenario K = 42 models
62.5Main ObjectivePrefUCB
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PrefUCB2026.06 | 62.5 | 45.7 | 69 | |
| ScalarizedUCBr.r.2026.06 | 59 | 56 | 64.5 | |
| GT-PF2026.06 | 57.3 | 55.7 | 61.2 | |
| ParetoUCB2026.06 | 53.3 | 51.8 | 57.1 |