ResearchBenchmarksMath Reasoning on AIME (test)Follow3,098Token Usage (Optimization Phase, Thousands)ETGPO2,525.926,387.4610,24914,110.54Feb 1, 2026Evaluation ResultsMethodMethodLinksToken Usage (Optimization Phase, Thousands)ETGPOBackbone=DeepSeek-V3.1...Backbone=DeepSeek-V3.1, Optimizer=GPT-4.12026.023,098GEPABackbone=DeepSeek-V3.1...Backbone=DeepSeek-V3.1, Optimizer=GPT-4.12026.029,899MIPROv2Backbone=DeepSeek-V3.1...Backbone=DeepSeek-V3.1, Optimizer=GPT-4.12026.0217,400