Opinion Summarization Evaluation on OPINSUMMEVAL
0.51Fluency (Spearman rho)OP-I-GPT-3.5
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| OP-I-GPT-3.5backbone=GPT-3.5, prompt_type=OP-I-PROMPT2024.02 | 0.51 | 0.46 | 0.36 | 0.32 | 0.33 | 0.29 | 0.43 | 0.39 | |
| CHATGPT-3.5backbone=GPT-3.52024.02 | 0.47 | 0.42 | 0.28 | 0.25 | 0.34 | 0.3 | 0.37 | 0.33 | |
| G-EVAL-MISTRALbackbone=Mistral-7B2024.02 | 0.46 | 0.41 | 0.41 | 0.38 | 0.36 | 0.32 | 0.49 | 0.45 | |
| OP-I-MISTRALbackbone=Mistral-7B, prompt_type=OP-I-PROMPT2024.02 | 0.46 | 0.41 | 0.37 | 0.35 | 0.38 | 0.34 | 0.49 | 0.45 | |
| BARTSCORE2024.02 | 0.42 | 0.33 | 0.35 | 0.29 | 0.28 | 0.22 | 0.41 | 0.34 | |
| G-EVAL-3.5backbone=GPT-3.52024.02 | 0.41 | 0.36 | 0.29 | 0.26 | 0.27 | 0.23 | 0.38 | 0.34 | |
| BERTSCORE2024.02 | 0.38 | 0.3 | 0.2 | 0.17 | 0.2 | 0.16 | 0.08 | 0.06 | |
| OP-MISTRALbackbone=Mistral-7B, prompt_type=OP-PROMPTS2024.02 | 0.35 | 0.33 | 0.45 | 0.41 | 0.34 | 0.3 | 0.45 | 0.41 | |
| ROUGE-22024.02 | 0.13 | 0.1 | 0.13 | 0.11 | 0.15 | 0.11 | 0.04 | 0.04 | |
| ROUGE-L2024.02 | 0.13 | 0.1 | 0.18 | 0.15 | 0.18 | 0.14 | 0.07 | 0.05 | |
| ROUGE-12024.02 | 0.08 | 0.06 | 0.11 | 0.09 | 0.14 | 0.11 | 0 | 0 | |
| SUMMAC2024.02 | 0.06 | 0.05 | 0.02 | 0.01 | 0.07 | 0.06 | 0.2 | 0.17 |