Overall
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Overall Aggregated
52.3Pass@1
18
Overall Combined Datasets
70.12Accuracy
18
Overall (test)
73.01Average Performance
17
Overall (test)
3.54Factual Alignment (FA)
17
Overall Across Benchmarks
44.3Avg@32 Accuracy
16
Overall
63.9Accuracy
15
Overall CNN/DM, GSM8K, HumanEval
3.04MAT
15
Overall Average
6.75Average Match Rate (MAT)
15
Overall
77.1Accuracy
15
Overall Across Cohorts
0.629C-Index
15
Overall BFCL, MCP-Atlas, τ²-Bench, VitaBench
33.4Average Success Rate
14
Overall IFEval, GSM8K, M-MMLU, M-ARC, M-HellaSwag, XSTest
1.015Average Normalized Performance
13
Overall (AIME, MMLU-Pro, MedMCQA, GPQA)
62.43Average Score
12
Overall
73.9Overall Accuracy
12
Overall Aggregate
68.7Accuracy
12
Overall Aggregated Models
0.765Spearman's Correlation
12
Overall 5-Benchmark Suite
73.5Average Score
12
Overall (Louvain splitting)
80Accuracy
11
Overall
41.6EM
11
Overall In-the-wild Aggregate
91.8Average Accuracy
11
Overall Multi-dataset Average
48Completeness
11
Overall
52.22F1 Score
10
Overall AIME 2025, GPQA-Diamond, LiveCodeBench v6, LongBench v2
57.67Avg@4
10
Overall Average across five scenarios
63.6Accuracy
10
Overall
53.5Recall@1
10