Community Summary Evaluation on podcast C3 (post-cutoff)
53Comprehensiveness WinMRC
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| MRCHeuristic Level=LF, Evaluator LLM=GPT-3.5-turbo2026.03 | 53 | 43 | 4 | 49 | 51 | 0 | — | — | — | |
| M2hCHeuristic Level=L1, Evaluator LLM=GPT-3.5-turbo2026.03 | 52 | 42 | 6 | 56 | 42 | 2 | — | — | — | |
| M2hCHeuristic Level=LF, Evaluator LLM=GPT-3.5-turbo2026.03 | 52 | 44 | 4 | 55 | 44 | 1 | — | — | — | |
| RkHHeuristic Level=L1, Evaluator LLM=GPT-3.5-turbo2026.03 | 50 | 42 | 8 | 52 | 44 | 4 | — | — | — | |
| MRCHeuristic Level=L1, Evaluator LLM=GPT-3.5-turbo2026.03 | 48 | 48 | 4 | 46 | 54 | 0 | — | — | — | |
| RkHHeuristic Level=LF, Evaluator LLM=GPT-3.5-turbo2026.03 | 44 | 52 | 4 | 44 | 52 | 4 | — | — | — | |
| M2hCHierarchy level=L1, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 59 | 39 | 2 | |
| M2hCHierarchy level=LF, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 54 | 46 | 0 | |
| MRCHierarchy level=L1, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 40 | 55 | 5 | |
| MRCHierarchy level=LF, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 47 | 50 | 3 | |
| RkHHierarchy level=L1, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 52 | 45 | 3 | |
| RkHHierarchy level=LF, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 54 | 43 | 3 |