Instruction Following
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
90.9Accuracy
6
Jul 1, 2026
78.3Accuracy
6
Jul 1, 2026
100Quality
6
Jun 26, 2026
56.7Goal Success Rate
6
Jun 23, 2026
42.4Object Success Rate
6
Jun 23, 2026
76.5Hard-Prompt Avg Score
6
Jun 4, 2026
89.4IFEval avg@4
6
Jun 4, 2026
36.13IFEVAL Score
6
Jun 2, 2026
92.8Instruct vs. Pretrained Win Rate
6
May 29, 2026
9.7Task Success Rate
6
May 26, 2026
33.7Task Success Rate
6
May 26, 2026
32.89ROUGE-L
6
May 22, 2026
0.22Accuracy
6
May 14, 2026
3.59Acceptance Length
6
May 12, 2026
27Pass@1
6
Apr 15, 2026
1.05Validation Loss
6
Apr 10, 2026
9.7Genuine Followup Rate
6
Apr 3, 2026
4.05LLM-as-a-Judge Score
6
Mar 26, 2026
4.4Overall LLM-as-a-Judge Score
6
Mar 26, 2026
4.4Overall LLM-as-a-Judge Score
6
Mar 26, 2026
38.07ROUGE-L
6
Mar 5, 2026
9.2Alpaca V2 Score
6
Mar 4, 2026
1.778Perplexity
6
Feb 26, 2026
15.04Average Score
6
Feb 26, 2026
5.68MT-Bench (ja) Score
6
Feb 26, 2026