Math Reasoning on GSM Hard
82.6AccuracyIPOMP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| IPOMPOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 82.6 | — | — | |
| POESOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 82.2 | — | — | |
| POESOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 81.8 | — | — | |
| RandomOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 81.1 | — | — | |
| IPOMPOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 81.1 | — | — | |
| PredictionOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 80.7 | — | — | |
| IPOMPOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 80.7 | — | — | |
| POESOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 80.3 | — | — | |
| PredictionOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 80.3 | — | — | |
| RandomOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 79.9 | — | — | |
| PredictionOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 79.9 | — | — | |
| SESSOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 79.9 | — | — | |
| RandomOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 79.5 | — | — | |
| AnchorOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 79.2 | — | — | |
| POESOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 78 | — | — | |
| SESSOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 78 | — | — | |
| SESSOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 76.1 | — | — | |
| AnchorOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 75.4 | — | — | |
| AnchorOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 72.7 | — | — | |
| AnchorOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 70.5 | — | — | |
| IPOMPOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 69.4 | — | — | |
| SESSOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 69.4 | — | — | |
| PredictionOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 69.4 | — | — | |
| RandomOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 68.9 | — | — | |
| SESSOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 68.6 | — | — | |
| RandomOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 68.6 | — | — | |
| POESOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 68.6 | — | — | |
| RandomOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 68.6 | — | — | |
| POESOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 68.6 | — | — | |
| AnchorOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 68.2 | — | — | |
| AnchorOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 67.5 | — | — | |
| MACABackbone=Llama-3.1-70B2026.05 | 67.37 | — | 2,747.7 | |
| FSLRBackbone=Qwen2-1.5B, Teacher Source=Qwen2026.01 | 66.9 | — | — | |
| IPOMPOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 66.7 | — | — | |
| IPOMPOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 66.7 | — | — | |
| SESSOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 66.4 | — | — | |
| PredictionOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 65.6 | — | — | |
| FSLRBackbone=Qwen2-1.5B, Teacher Source=LLaMA2026.01 | 64.9 | — | — | |
| FSLRBackbone=Qwen2-1.5B, Teacher Source=Self2026.01 | 64.4 | — | — | |
| MaASBackbone=Llama-3.1-70B2026.05 | 64.03 | — | 3,125.8 | |
| FSLRBackbone=Qwen2.5-7B, Teacher Source=Self2026.01 | 63.5 | — | — | |
| Base LLMBackbone=Qwen2.5-7B, Mode=Few-shot2026.01 | 62.9 | — | — | |
| Base LLMBackbone=Qwen2-1.5B, Mode=Zero-shot2026.01 | 62.4 | — | — | |
| CoT-SFTBackbone=Qwen2-1.5B, Teacher Source=Qwen2026.01 | 61.6 | — | — | |
| CoT-SFTBackbone=Qwen2.5-7B, Teacher Source=Self2026.01 | 61.5 | — | — | |
| FSLRBackbone=Qwen2.5-7B, Teacher Source=Qwen2026.01 | 60.7 | — | — | |
| CoT-SFTBackbone=Qwen2.5-7B, Teacher Source=Qwen2026.01 | 60 | — | — | |
| FSLRBackbone=Qwen2.5-7B, Teacher Source=LLaMA2026.01 | 59 | — | — | |
| CoTBackbone=Llama-3.1-70B2026.05 | 57.14 | — | 292.8 | |
| DeepSeek-MathMode=Zero-shot2026.01 | 56.1 | — | — | |
| Base LLMBackbone=Qwen2-1.5B, Mode=Few-shot2026.01 | 56 | — | — | |
| Qwen2.5-MathMode=Zero-shot2026.01 | 55.4 | — | — | |
| DyLANBackbone=Llama-3.1-70B2026.05 | 55.05 | — | 14,186.4 | |
| CoT-SFTBackbone=Qwen2-1.5B, Teacher Source=Self2026.01 | 53.5 | — | — | |
| Base LLMBackbone=Qwen2.5-7B, Mode=Zero-shot2026.01 | 53.4 | — | — | |
| CoT-SFTBackbone=Qwen2-1.5B, Teacher Source=LLaMA2026.01 | 53.1 | — | — | |
| AgentPruneBackbone=Llama-3.1-70B2026.05 | 51.44 | — | 4,372.5 | |
| CoT-SFTBackbone=Qwen2.5-7B, Teacher Source=LLaMA2026.01 | 50.7 | — | — | |
| VanillaBackbone=Llama-3.1-70B2026.05 | 48.87 | — | 206.7 | |
| PredictionOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 48.1 | — | — | |
| FSLRBackbone=LLaMA3.1-8B, Teacher Source=Qwen2026.01 | 43.6 | — | — | |
| CoT-SFTBackbone=LLaMA3.1-8B, Teacher Source=Qwen2026.01 | 43.4 | — | — | |
| FSLRBackbone=LLaMA3.1-8B, Teacher Source=LLaMA2026.01 | 40.8 | — | — | |
| Base LLMBackbone=LLaMA3.1-8B, Mode=Few-shot2026.01 | 38.7 | — | — | |
| FSLRBackbone=LLaMA3.1-8B, Teacher Source=Self2026.01 | 38.3 | — | — | |
| CoT-SFTBackbone=LLaMA3.1-8B, Teacher Source=LLaMA2026.01 | 35.6 | — | — | |
| CoT-SFTBackbone=LLaMA3.1-8B, Teacher Source=Self2026.01 | 33 | — | — | |
| Base LLMBackbone=LLaMA3.1-8B, Mode=Zero-shot2026.01 | 31.7 | — | — | |
| ReGuLaRBackbone=LLaMA-3.2-1B-Instruct2026.01 | 8.27 | 4.12 | — | |
| CoLaRBackbone=LLaMA-3.2-1B-Instruct, Compression Rate=52026.01 | 6.23 | 7.01 | — | |
| CoconutBackbone=LLaMA-3.2-1B-Instruct2026.01 | 4.86 | 6 | — | |
| iCoTBackbone=LLaMA-3.2-1B-Instruct2026.01 | 3.87 | 0 | — | |
| CODIBackbone=LLaMA-3.2-1B-Instruct2026.01 | 2.97 | 6 | — |