Explanation Quality Evaluation on LIAR RAW
2.29Meaningfulness ScoreChatGPT w/ evi
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ChatGPT w/ eviBackbone=ChatGPT, Evidence Usage=With evidence2025.11 | 2.29 | 3.71 | 4.04 | 3.99 | |
| ChatGPT w/o eviBackbone=ChatGPT, Evidence Usage=Without evidence2025.11 | 2.27 | 3.93 | 4.29 | 4.5 | |
| L-DefenseBackbone=LLaMA22025.11 | 2.2 | 4.39 | 4.64 | 4.63 | |
| L-DefenseBackbone=ChatGPT2025.11 | 2.06 | 4.12 | 4.28 | 4.47 | |
| SFTBackbone=LLaMA22025.11 | 1.9 | 4.48 | 4.6 | 4.65 | |
| Oracle - skylineBackbone=ChatGPT, Evidence Usage=Gold claims and verdicts2025.11 | 1.85 | 4.44 | 4.6 | 4.69 | |
| S-EGSBackbone=LLaMA22025.11 | 1.77 | 4.58 | 4.66 | 4.83 |