Overall
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Overall
89.6Accuracy
81
Overall
84.8Accuracy
40
Overall NQ, TriviaQA, BioASQ, PopQA
0.617Accuracy
32
Overall Combined Benchmarks
88.7Accuracy
31
Overall NaturalPlan AIME 2024 GPQA
96.5Final Score (Macro-Avg)
28
Overall 13 datasets aggregate
85.7N-Mean
26
Overall GSM8K, MATH-500, AMC, AIME24, AIME25
91.6Accuracy
26
Overall GSM8K, MATH-500, AMC 2023, AIME 2024, AIME 2025
79.8Accuracy
24
Overall Across five math reasoning datasets
45.8Overall Accuracy
24
Overall
93.51Accuracy
24
Overall MATH-500 AIME25 HumanEval GPQA
85.1Accuracy
24
Overall Combined 5 Datasets (test)
85.1mDice
24
Overall DB15K, MKG-W, MKG-Y
41.04MRR
22
Overall Aggregate
1.003Average Score
22
Overall Combined Benchmarks
49.64Performance (Seen Data)
21
Overall AMC23, AIME24, MATH500, GPQA-D aggregate
79.1Accuracy
21
Overall Combined Datasets
0.844mDice
21
Overall CSQA, StrategyQA, LogiQA
64.95Accuracy
20
Overall (Average)
80.5Recall@10
20
Overall Macro-average
70.97Accuracy (%)
20
Overall
62.05Overall Score
19
Overall
84.87Accuracy
19
Overall Dirichlet α=0.3 partition
70Accuracy
18
Overall 20 Chunks
61.22MAP
18
Overall 15 Chunks
59.99MAP
18