Natural Language Explanation Generation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
0.102Faithfulness
9
Apr 28, 2026
0.033Faithfulness
9
Apr 28, 2026
70Human Evaluation Score
7
Feb 26, 2026
71.11Human Evaluation Score
7
Feb 26, 2026
73.33Human Evaluation Score
7
Feb 26, 2026
50Human Evaluation Score
7
Apr 28, 2026
67.34AUC
6
Mar 20, 2026
86.66Accuracy
6
Feb 26, 2026
66.99Accuracy
6
Feb 26, 2026
59.4Accuracy
6
Feb 26, 2026
0.96Simul.
5
Feb 26, 2026
97Simul.
5
Feb 26, 2026
0.95Similarity
5
Feb 26, 2026
5Explanation Utility
3
Feb 26, 2026
40.1Accuracy
3
Feb 26, 2026
63.86Accuracy
3
Feb 26, 2026
24.53Accuracy
3
Feb 26, 2026
68.03Accuracy
3
Feb 26, 2026