ResearchBenchmarksMath Reasoning on HMMT (test)Follow3,295Optimization-phase Token Usage (thousands)ETGPO2,745.726,453.3610,16113,868.64Feb 1, 2026Evaluation ResultsMethodMethodLinksOptimization-phase Token Usage (thousands)ETGPOBackbone=DeepSeek-V3.1...Backbone=DeepSeek-V3.1, Optimizer=GPT-4.12026.023,295GEPABackbone=DeepSeek-V3.1...Backbone=DeepSeek-V3.1, Optimizer=GPT-4.12026.029,923MIPROv2Backbone=DeepSeek-V3.1...Backbone=DeepSeek-V3.1, Optimizer=GPT-4.12026.0217,027