ResearchBenchmarksMathematical Reasoning on AIME-90 (test)Follow32.2Accuracy (Full)Qwen331.05631.35331.6531.947Jun 29, 2026Evaluation ResultsMethodMethodLinksAccuracy (Full)Total TokensPerformance Gain (Learned Peak)Best Scalar GainLearned vs Best Scalar Difference95% CI (Lower Bound)Validation vs Selection DifferenceQwen3Model=32BModel=32B2026.0632.27,283—————Qwen3Model=8BModel=8B2026.0631.17,488—————Ent.Model=8BModel=8B2026.06———0.055———LearnStopModel=8BModel=8B2026.06——0.032—-0.024-0.0850.044LearnStopModel=32BModel=32B2026.06——0.016—-0.01-0.033-0.009StableModel=32BModel=32B2026.06———0.026———