Community Summary Evaluation on podcast C2 (post-cutoff)
58Comprehensiveness WinRkH
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| RkHHeuristic Level=LF, Evaluator LLM=GPT-3.5-turbo2026.03 | 58 | 42 | 0 | 56 | 42 | 2 | — | — | — | |
| M2hCHeuristic Level=L1, Evaluator LLM=GPT-3.5-turbo2026.03 | 58 | 36 | 6 | 64 | 32 | 4 | — | — | — | |
| M2hCHeuristic Level=LF, Evaluator LLM=GPT-3.5-turbo2026.03 | 58 | 40 | 2 | 66 | 34 | 0 | — | — | — | |
| RkHHeuristic Level=L1, Evaluator LLM=GPT-3.5-turbo2026.03 | 56 | 36 | 8 | 46 | 50 | 4 | — | — | — | |
| MRCHeuristic Level=L1, Evaluator LLM=GPT-3.5-turbo2026.03 | 50 | 44 | 6 | 50 | 50 | 0 | — | — | — | |
| MRCHeuristic Level=LF, Evaluator LLM=GPT-3.5-turbo2026.03 | 50 | 50 | 0 | 52 | 48 | 0 | — | — | — | |
| M2hCHierarchy level=L1, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 54 | 44 | 2 | |
| M2hCHierarchy level=LF, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 50 | 46 | 4 | |
| MRCHierarchy level=L1, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 39 | 54 | 7 | |
| MRCHierarchy level=LF, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 36 | 56 | 8 | |
| RkHHierarchy level=L1, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 48 | 50 | 2 | |
| RkHHierarchy level=LF, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 52 | 43 | 5 |