Natural Language Inference Explanation Evaluation on MNLI (sample)
92.5Average ScoreGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oevaluation_target=standard explanations2025.02 | 92.5 | |
| MorphNLIevaluation_target=morphism quality only2025.02 | 82.5 | |
| MorphNLIevaluation_target=modular approach explanations2025.02 | 70 | |
| Llama 3.1 8Bevaluation_target=standard explanations2025.02 | 56.67 |