Community Summary Evaluation on news C3 (post-cutoff)
56Comprehensiveness WinM2hC
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| M2hCHeuristic Level=LF, Evaluator LLM=GPT-3.5-turbo2026.03 | 56 | 38 | 6 | 61 | 37 | 2 | — | — | — | |
| RkHHeuristic Level=L1, Evaluator LLM=GPT-3.5-turbo2026.03 | 52 | 38 | 10 | 36 | 58 | 6 | — | — | — | |
| M2hCHeuristic Level=L1, Evaluator LLM=GPT-3.5-turbo2026.03 | 50 | 36 | 14 | 44 | 50 | 6 | — | — | — | |
| RkHHeuristic Level=LF, Evaluator LLM=GPT-3.5-turbo2026.03 | 49 | 47 | 4 | 56 | 44 | 0 | — | — | — | |
| MRCHeuristic Level=LF, Evaluator LLM=GPT-3.5-turbo2026.03 | 48 | 48 | 4 | 56 | 44 | 0 | — | — | — | |
| MRCHeuristic Level=L1, Evaluator LLM=GPT-3.5-turbo2026.03 | 42 | 46 | 12 | 48 | 44 | 8 | — | — | — | |
| M2hCHierarchy level=L1, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 55 | 45 | 0 | |
| M2hCHierarchy level=LF, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 46 | 54 | 0 | |
| MRCHierarchy level=L1, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 38 | 60 | 2 | |
| MRCHierarchy level=LF, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 65 | 30 | 5 | |
| RkHHierarchy level=L1, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 63 | 37 | 0 | |
| RkHHierarchy level=LF, Evaluation model=GPT-3.5-turbo2026.03 | — | — | — | — | — | — | 57 | 40 | 3 |