Mean
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Mean (MT-Bench, HumanEval, GSM8K)
6.52Average Acceptance Length (τ)
112
Mean GSM8K, HumanEval, MBPP
4Speed
26
MEAN Across datasets
72.8F1 Score
20
Mean Across MBPP, CodeAlpacaPy, HumanEval, LiveCodeBench
4.04Speedup
14
Mean
73Accuracy
13
Mean Across Datasets
80.9R@1
12
Mean Across T1, T2, T3
99Mean Grasp Success Rate
10
Mean Across Frontier Commercial Generators
87.25Accuracy
7
Mean (GSM8K, MATH, HumanEval, MBPP)
52.06Accuracy
7
Mean Medium-Replay
76.45Normalized Return
7
Mean Medium
71.33Normalized Return
7
Mean Medium-Expert
98.5Normalized Return
7
Mean All scenes
31.8PSNR
4
Mean across benchmarks
2.12Speedup
2