Natural Language Understanding and Reasoning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
80.7PiQA Accuracy (Zero-shot)
39
May 19, 2026
65.36ARC-c Accuracy (zero-shot)
20
May 14, 2026
69.72Average Score (Zero-shot)
20
Mar 16, 2026
56.86ARC-E Accuracy (Normalized)
11
Feb 26, 2026
37.47ARC-C-it
6
Feb 26, 2026