Key Point Information Quality Human Evaluation on AMAZONKP (test)
28.44CoverageQQSUM-RAG
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| QQSUM-RAGLLM Backbone=Mistral2025.06 | 28.44 | 26.56 | 25.34 | 35.23 | 31.11 | 25.9 | 24.8 | |
| Frozen Retriever + RKPA-Base2025.06 | 16.2 | 22.28 | 15.73 | 22.91 | 20.75 | 21.02 | 18.77 | |
| Frozen Retriever + prompt LLMLLM Backbone=GPT-4-Turbo2025.06 | 15.12 | 12.84 | 15.73 | 10.36 | 14.6 | 12.59 | 10.79 | |
| (Retriever + LLM)co-trainLLM Backbone=Mistral2025.06 | 11.06 | 11.17 | 14.7 | 9.99 | 9.54 | 13.49 | 17.52 | |
| Frozen Retriever + PAKPA2025.06 | 9.94 | 12.41 | 13.28 | 7.7 | 8.87 | 13.04 | 9.34 |