Explanation Quality Evaluation on RAW-FC
2.07M ScoreChatGPT w/ evi
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ChatGPT w/ eviBackbone=ChatGPT, Evidence Usage=With evidence2025.11 | 2.07 | 4.44 | 4.62 | 4.69 | |
| ChatGPT w/o eviBackbone=ChatGPT, Evidence Usage=Without evidence2025.11 | 1.97 | 4 | 4.44 | 4.68 | |
| L-DefenseBackbone=LLaMA22025.11 | 1.95 | 4.44 | 4.67 | 4.62 | |
| L-DefenseBackbone=ChatGPT2025.11 | 1.91 | 4.17 | 4.41 | 4.49 | |
| SFTBackbone=LLaMA22025.11 | 1.9 | 4.78 | 4.82 | 4.55 | |
| S-EGSBackbone=LLaMA22025.11 | 1.79 | 4.88 | 4.83 | 4.8 | |
| Oracle - skylineBackbone=ChatGPT, Evidence Usage=Gold claims and verdicts2025.11 | 1.52 | 4.46 | 4.73 | 4.72 |