Unseen prompt generalization
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
36.29Accuracy
6
Feb 26, 2026
77.5Accuracy
2
Feb 26, 2026
77.87Accuracy
2
Feb 26, 2026
74.89Accuracy
2
Feb 26, 2026
98Accuracy
2
Feb 26, 2026
70.93Accuracy
2
Feb 26, 2026
92.13Accuracy
2
Feb 26, 2026
77.8Accuracy
2
Feb 26, 2026
75.3Accuracy
2
Feb 26, 2026
60.8Accuracy
2
Feb 26, 2026
94.93Accuracy
2
Feb 26, 2026