Human Alignment Evaluation on GenOverall
0.367Pearson Correlation (Mean)Kem
Evaluation Results
| Method | Links | ||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| KemAggregation Method=Kemeny-Young, Evaluation Level=Micro-level2025.10 | 0.367 | 0.54 | -0.771 | -0.214 | 0.571 | 0.786 | 1 | 0.362 | 0.355 | -0.467 | 0.133 | 0.467 | 0.6 | 1 | |
| KenAggregation Method=Kendall, Evaluation Level=Micro-level2025.10 | 0.345 | 0.539 | -0.771 | -0.214 | 0.486 | 0.771 | 1 | 0.35 | 0.353 | -0.467 | 0.067 | 0.467 | 0.6 | 1 | |
| CopAggregation Method=Copeland, Evaluation Level=Micro-level2025.10 | 0.342 | 0.536 | -0.771 | -0.214 | 0.514 | 0.771 | 1 | 0.322 | 0.328 | -0.467 | 0.133 | 0.467 | 0.6 | 0.867 | |
| 4o08Model=gpt-4o-20240806, Evaluation Level=Micro-level2025.10 | 0.313 | 0.499 | -0.771 | 0.029 | 0.343 | 0.671 | 1 | 0.261 | 0.357 | -0.467 | 0.067 | 0.2 | 0.467 | 1 | |
| DodAggregation Method=Dodgson, Evaluation Level=Micro-level2025.10 | 0.313 | 0.521 | -0.771 | -0.214 | 0.543 | 0.714 | 1 | 0.37 | 0.34 | -0.467 | 0.133 | 0.467 | 0.6 | 1 | |
| 4o05Model=gpt-4o-20240513, Evaluation Level=Micro-level2025.10 | 0.311 | 0.511 | -0.771 | -0.043 | 0.371 | 0.671 | 1 | 0.291 | 0.343 | -0.467 | 0.067 | 0.333 | 0.467 | 1 | |
| BorAggregation Method=Borda Count, Evaluation Level=Micro-level2025.10 | 0.302 | 0.526 | -0.771 | -0.214 | 0.514 | 0.671 | 1 | 0.348 | 0.358 | -0.467 | 0.067 | 0.467 | 0.6 | 1 | |
| AvgAggregation Method=Average voting, Evaluation Level=Micro-level2025.10 | 0.3 | 0.53 | -0.784 | -0.203 | 0.504 | 0.683 | 0.968 | 0.322 | 0.359 | -0.467 | 0.067 | 0.414 | 0.552 | 1 | |
| 4o11Model=gpt-4o-20241120, Evaluation Level=Micro-level2025.10 | 0.296 | 0.494 | -0.829 | 0.014 | 0.343 | 0.671 | 1 | 0.245 | 0.336 | -0.6 | 0.067 | 0.333 | 0.467 | 0.867 | |
| SpmAggregation Method=Spearman, Evaluation Level=Micro-level2025.10 | 0.289 | 0.517 | -0.771 | -0.214 | 0.457 | 0.671 | 0.943 | 0.328 | 0.368 | -0.467 | 0.067 | 0.333 | 0.6 | 1 | |
| Op02Model=claude-3-opus-20240229, Evaluation Level=Micro-level2025.10 | 0.169 | 0.504 | -0.771 | -0.314 | 0.343 | 0.5 | 0.943 | 0.139 | 0.317 | -0.467 | -0.067 | 0.2 | 0.433 | 0.733 | |
| Sn10Model=claude-3.5-Sonnet-20241022, Evaluation Level=Micro-level2025.10 | 0.156 | 0.511 | -0.829 | -0.271 | 0.257 | 0.486 | 0.943 | 0.131 | 0.326 | -0.6 | -0.067 | 0.133 | 0.333 | 0.733 | |
| Hk10Model=claude-3.5-haiku-20241022, Evaluation Level=Micro-level2025.10 | 0.024 | 0.493 | -0.714 | -0.257 | -0.086 | 0.371 | 0.943 | 0.092 | 0.345 | -0.733 | -0.133 | 0.067 | 0.333 | 0.867 | |
| IrvAggregation Method=Instant-runoff voting, Evaluation Level=Micro-level2025.10 | -0.151 | 0.475 | -1 | -0.657 | -0.143 | 0.2 | 0.714 | -0.237 | 0.386 | -0.867 | -0.467 | -0.333 | 0.067 | 0.6 |