Math Reasoning on MultiArith (Accuracy)
98.3AccuracyPOES
Evaluation Results
| Method | Links | |
|---|---|---|
| POESOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 98.3 | |
| AnchorOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 98.3 | |
| TopLoRAModel=Qwen2.5-14B, # Params(%)=0.102026.04 | 97.67 | |
| RandomOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 97.5 | |
| PredictionOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 97.5 | |
| MELoRAModel=Qwen2.5-14B, # Params(%)=0.122026.04 | 97.33 | |
| FourierMoEModel=Qwen2.5-14B, # Params(%)=0.052026.04 | 97.33 | |
| SESSOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 96.7 | |
| POESOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 96.7 | |
| RandomOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 96.7 | |
| PredictionOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 96.7 | |
| POESOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 96.7 | |
| POESOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 96.7 | |
| POESOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 96.7 | |
| DoRAModel=Qwen2.5-14B, # Params(%)=0.132026.04 | 96.39 | |
| LoRAModel=Qwen2.5-14B, # Params(%)=0.122026.04 | 96.33 | |
| HydraLoRAModel=Qwen2.5-14B, # Params(%)=0.122026.04 | 96.22 | |
| IPOMPOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 95.8 | |
| AnchorOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 95.8 | |
| SESSOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 95.8 | |
| PredictionOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 95.8 | |
| IPOMPOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 95.8 | |
| AnchorOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 95 | |
| FFTModel=LLaMA2-7B2026.04 | 94.43 | |
| PredictionOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 94.2 | |
| IPOMPOptimizer=EvoPrompt-GA, Model=Qwen-2.5-7B-Instruct2026.04 | 94.2 | |
| GRASSModel=Gemma-2B2026.04 | 93.5 | |
| RandomOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 93.3 | |
| AnchorOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 93.3 | |
| PredictionOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 93.3 | |
| POESOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 93.3 | |
| SESSOptimizer=EvoPrompt-DE, Model=Qwen-2.5-7B-Instruct2026.04 | 93.3 | |
| FourierMoEModel=LLaMA-3 8B, # Params(%)=0.012026.04 | 93.16 | |
| DoRAModel=LLaMA2-7B2026.04 | 93.16 | |
| LoRAModel=Gemma-2B, Rank=2562026.04 | 92.5 | |
| RandomOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 92.5 | |
| SESSOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 92.5 | |
| IPOMPOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 92.5 | |
| RandomOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 92.5 | |
| SESSOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 92.5 | |
| IPOMPOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 92.5 | |
| DoRAModel=Gemma-2B2026.04 | 92.17 | |
| GRASSModel=LLaMA2-7B2026.04 | 92 | |
| RandomOptimizer=OPRO, Model=Qwen-2.5-7B-Instruct2026.04 | 91.7 | |
| PredictionOptimizer=EvoPrompt-GA, Model=Llama-3.1-8B-Instruct2026.04 | 91.7 | |
| AnchorOptimizer=EvoPrompt-DE, Model=Llama-3.1-8B-Instruct2026.04 | 91.7 | |
| LoRAModel=Gemma-2B, Rank=1282026.04 | 91.5 | |
| LoRAModel=LLaMA-3 8B, # Params(%)=0.122026.04 | 91.22 | |
| LISAModel=LLaMA2-7B2026.04 | 91.17 | |
| HydraLoRAModel=LLaMA-3 8B, # Params(%)=0.112026.04 | 91 | |
| LoRAModel=LLaMA2-7B, Rank=1282026.04 | 90.5 | |
| LoRAModel=LLaMA2-7B, Rank=2562026.04 | 90.5 | |
| LISAModel=Gemma-2B2026.04 | 90.17 | |
| DoRAModel=LLaMA-3 8B, # Params(%)=0.122026.04 | 89.67 | |
| IPOMPOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 89.2 | |
| MELoRAModel=LLaMA-3 8B, # Params(%)=0.122026.04 | 87.83 | |
| FFTModel=Gemma-2B2026.04 | 86.67 | |
| SESSOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 85 | |
| AnchorOptimizer=OPRO, Model=Llama-3.1-8B-Instruct2026.04 | 78.3 | |
| GRASSModel=TinyLlama2026.04 | 68 | |
| DoRAModel=TinyLlama2026.04 | 67.83 | |
| LoRAModel=TinyLlama, Rank=2562026.04 | 65.5 | |
| LISAModel=TinyLlama2026.04 | 65 | |
| FFTModel=TinyLlama2026.04 | 64.17 | |
| LoRAModel=TinyLlama, Rank=1282026.04 | 61.17 |