Session-level correlation with human ratings on MultiChallenge
0.74Spearman Correlation (ρ)SKG-Eval
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SKG-Eval2026.05 | 0.74 | 0.77 | |
| GPT-4o-JudgeType=history-aware2026.05 | 0.61 | 0.64 | |
| DeepEval + GPT-4oEvaluator=DeepEval + GPT-4o2026.05 | 0.52 | 0.55 | |
| GPT-4o-JudgeType=turn-only2026.05 | 0.49 | 0.52 | |
| LLM-Eval2026.05 | 0.45 | 0.48 | |
| ECoh2026.05 | 0.38 | 0.41 |