Aggregate
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Aggregate Malaria, Whole Blood Cells
29.27APU
7
Aggregate
94.74Accuracy
6
Aggregate Average across applicable datasets
89.9micro-F1
6
Aggregate (Koala, JBench-B, GSM-8k, SQL-1k, OrBench-H, SorryBench, JBench-H, HEX-PHI)
77.03Average Score
6
Aggregate (POL, ELEV, BIKE, PROT, KEGG)
7.2Average Speed-Up
6
Aggregate 1D PDE, Depth Regression, and Weather Prediction
3.25SSE
5
Aggregate (CoNLL, FNERD, WNUT, TQA, NQ, STEM, Humanities, JSON) (test)
0.009Risk
5
Aggregate of 16 datasets (test)
126.2Throughput (tokens/s)
5
Aggregate 90 configurations of backbone, dataset, H (test)
90Win Count
5
Aggregate VideoMME, EgoSchema, LongVideoBench, MLVU, VideoMMMU
55.6Average Score
5
Aggregate All Tasks
80Accuracy
5
Aggregate MIF, MMMLU, GPQA, ARC-C, BBH, MATH, GSM8K (all)
58.24Mean Accuracy
5
Aggregate
95.7Micro-F1 Score
5
Aggregate PiQA, ARC, HellaSwag, WinoGrande, MMLU
75.2Aggregate Accuracy
5
Aggregate All Tasks
76AVG
5
Aggregate 234 languages
54.1Score
5
Aggregate (HotpotQA, IFBench, HoVer, PUPA)
6,259Max System Prompt Token Length
4
Aggregate Mip-Nerf360, Tanks & Temples, NeRF-Synthetic (test)
47Training Time
4
Aggregate (All)
41.2Accuracy
4
Aggregate (ACE, Casie, AgNews, SST5, CB, R8)
76Average Score
4
Aggregate 4 datasets n=240
0.575NMI
4
Aggregate (GUI-Act-Web, OmniAct-Web, AndroidControl)
74.6Overall Accuracy
4
Aggregate General, Math, Coding
65.3Average Accuracy
4
Aggregate SST-2, AGNews, 20News, SNLI, MNLI, MMLU
2.32Total Speedup
3
Aggregate (VOID, NYUv2, KITTI)
0.762RMSE
3