Model Ranking on TruthfulQA LLM-Judge (test)
0.49Kendall's TauAdaptive Multi-Model Ranking
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Adaptive Multi-Model RankingRanking Strategy=Adaptive2026.01 | 0.49 | 93 | 2.9 | |
| BaselineRanking Strategy=Baseline2026.01 | 0.4 | — | — |
| Method | Links | |||
|---|---|---|---|---|
| Adaptive Multi-Model RankingRanking Strategy=Adaptive2026.01 | 0.49 | 93 | 2.9 | |
| BaselineRanking Strategy=Baseline2026.01 | 0.4 | — | — |