Conversation Summarization on Stack
57.75QAGSThreadSumm
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ThreadSummLLM Backbone=CLAUDE2026.04 | 57.75 | 50.29 | 39.29 | |
| ThreadSummLLM Backbone=LLAMA2026.04 | 51.28 | 42.44 | 38.39 | |
| ThreadSummLLM Backbone=GPT-42026.04 | 49.94 | 33.46 | 35.89 | |
| arg-graphLLM Backbone=CLAUDE2026.04 | 42.61 | 37.07 | 30.48 | |
| CHRONOSLLM Backbone=CLAUDE2026.04 | 41.64 | 33.56 | 27.76 | |
| VanillaLLM Backbone=CLAUDE2026.04 | 40.05 | 36.79 | 31.86 | |
| mRedditSummLLM Backbone=CLAUDE2026.04 | 39.93 | 34.87 | 29.22 | |
| mRedditSummLLM Backbone=LLAMA2026.04 | 37.36 | 35 | 31.96 | |
| arg-graphLLM Backbone=LLAMA2026.04 | 36.75 | 38.97 | 27.35 | |
| arg-graphLLM Backbone=GPT-42026.04 | 34.55 | 34.44 | 29.22 | |
| mRedditSummLLM Backbone=GPT-42026.04 | 34.55 | 35.1 | 31.84 | |
| CHRONOSLLM Backbone=GPT-42026.04 | 33.82 | 35.23 | 31.62 | |
| VanillaLLM Backbone=GPT-42026.04 | 33.46 | 35.34 | 32.24 | |
| VanillaLLM Backbone=LLAMA2026.04 | 32.84 | 32.46 | 32.69 | |
| CHRONOSLLM Backbone=LLAMA2026.04 | 31.5 | 36.41 | 28.82 | |
| ThreadSummevaluation=LLM-as-a-judge2026.04 | 9.1 | 9.2 | 8.9 | |
| Vanillaevaluation=LLM-as-a-judge2026.04 | 8.6 | 8.9 | 8.6 | |
| ThreadSummevaluation=LLM-as-a-judge2026.04 | 8.6 | 9 | 8.5 | |
| CHRONOSevaluation=LLM-as-a-judge2026.04 | 8.5 | 7.2 | 8.6 | |
| arg-graphevaluation=LLM-as-a-judge2026.04 | 8.4 | 7.9 | 7.4 | |
| mRedditSummevaluation=LLM-as-a-judge2026.04 | 8.2 | 8.7 | 8.3 | |
| CHRONOSevaluation=LLM-as-a-judge2026.04 | 8 | 8.8 | 8 | |
| mRedditSummevaluation=LLM-as-a-judge2026.04 | 7.9 | 8.9 | 8.5 | |
| arg-graphevaluation=LLM-as-a-judge2026.04 | 7.6 | 8.7 | 6.7 | |
| Vanillaevaluation=LLM-as-a-judge2026.04 | 7.6 | 8.5 | 7.8 |