Mathematical Reasoning on SVAMP (Accuracy (%))
95.2Accuracy (%)MetaEvo
Evaluation Results
| Method | Links | |
|---|---|---|
| MetaEvoBackbone=Qwen2.5-14B-Instruct2026.05 | 95.2 | |
| MetaEvoBackbone=LLaMA3.1-8B-Instruct2026.05 | 93.8 | |
| MetaEvo - w/o MOBackbone=Qwen2.5-14B-Instruct2026.05 | 93.8 | |
| MetaEvo - w/o CDABackbone=Qwen2.5-14B-Instruct2026.05 | 93.7 | |
| Self-DiscoverBackbone=Qwen2.5-14B-Instruct2026.05 | 93.4 | |
| SE-GPTBackbone=Qwen2.5-14B-Instruct2026.05 | 93.3 | |
| Self-RefineBackbone=Qwen2.5-14B-Instruct2026.05 | 91.8 | |
| Base ModelBackbone=Qwen2.5-14B-Instruct2026.05 | 91.5 | |
| Self-ICLBackbone=Qwen2.5-14B-Instruct2026.05 | 90.3 | |
| MetaEvo - w/o MOBackbone=LLaMA3.1-8B-Instruct2026.05 | 90.1 | |
| Self-DiscoverBackbone=LLaMA3.1-8B-Instruct2026.05 | 88.7 | |
| SE-GPTBackbone=LLaMA3.1-8B-Instruct2026.05 | 87.1 | |
| Hard-Routed MoR-LoRABackbone=LLaMA-8B2026.06 | 85.67 | |
| IDBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 85.4 | |
| Self-ICLBackbone=LLaMA3.1-8B-Instruct2026.05 | 85 | |
| IWDBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 85 | |
| GREATSBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 84.8 | |
| COLMBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 84.2 | |
| GradNormBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 84.1 | |
| PartitionSelBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 84.1 | |
| LoRiModel=LLaMA-3.1-8B, Explicit CoT=false2026.06 | 83.3 | |
| LoRi-EModel=LLaMA-3.1-8B, Explicit CoT=false2026.06 | 83.3 | |
| Base ModelBackbone=LLaMA3.1-8B-Instruct2026.05 | 83.3 | |
| Self-RefineBackbone=LLaMA3.1-8B-Instruct2026.05 | 83.2 | |
| RandomBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 83.2 | |
| BaselineBackbone=LLaMA-8B2026.06 | 82 | |
| Hard-Routed MoR-LoRABackbone=LLaMA-3B2026.06 | 81.33 | |
| MetaEvo - w/o CDABackbone=LLaMA3.1-8B-Instruct2026.05 | 81.3 | |
| SFT-CoTModel=LLaMA-3.1-8B, Explicit CoT=true2026.06 | 81 | |
| SIM-CoTModel=LLaMA-3.1-8B, Explicit CoT=false2026.06 | 79.4 | |
| LoRi-EModel=LLaMA-3.2-3B, Explicit CoT=false2026.06 | 79.3 | |
| SFT-CoTModel=LLaMA-3.2-3B, Explicit CoT=true2026.06 | 78.7 | |
| CODIModel=LLaMA-3.1-8B, Explicit CoT=false2026.06 | 78.1 | |
| LoRiModel=LLaMA-3.2-3B, Explicit CoT=false2026.06 | 75 | |
| SIM-CoTModel=LLaMA-3.2-3B, Explicit CoT=false2026.06 | 74.9 | |
| KAVAModel=LLaMA-3.2-3B, Explicit CoT=false2026.06 | 72.7 | |
| CODIModel=LLaMA-3.2-3B, Explicit CoT=false2026.06 | 72.4 | |
| PCCoTModel=LLaMA-3.2-3B, Explicit CoT=false2026.06 | 69.5 | |
| FRAMEBackbone=LLaMA-3.1-8B2026.06 | 68.4 | |
| MoABackbone=LLaMA-3.1-8B2026.06 | 67.3 | |
| FourierMoEBackbone=LLaMA-3.1-8B2026.06 | 67.1 | |
| FlyLoRABackbone=LLaMA-3.1-8B2026.06 | 67 | |
| HMoRABackbone=LLaMA-3.1-8B2026.06 | 66.7 | |
| MixLoRABackbone=LLaMA-3.1-8B2026.06 | 66.3 | |
| HydraLoRABackbone=LLaMA-3.1-8B2026.06 | 65.8 | |
| DoRABackbone=LLaMA-3.1-8B2026.06 | 65.2 | |
| FourierFTBackbone=LLaMA-3.1-8B2026.06 | 64.7 | |
| LoRABackbone=LLaMA-3.1-8B2026.06 | 64.5 | |
| LoRi-EModel=LLaMA-3.2-1B, Explicit CoT=false2026.06 | 64.3 | |
| LoRiModel=LLaMA-3.2-1B, Explicit CoT=false2026.06 | 64 | |
| LoRiModel=Qwen2.5-0.5B, Explicit CoT=false2026.06 | 63 | |
| LoRi-EModel=Qwen2.5-0.5B, Explicit CoT=false2026.06 | 62.7 | |
| SFT-CoTModel=Qwen2.5-0.5B, Explicit CoT=true2026.06 | 62.3 | |
| CODIModel=LLaMA-3.2-1B, Explicit CoT=false2026.06 | 61.1 | |
| SFT-CoTModel=LLaMA-3.2-1B, Explicit CoT=true2026.06 | 61 | |
| COLMBackbone=Llama-3.1-8B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 60.8 | |
| KAVAModel=LLaMA-3.2-1B, Explicit CoT=false2026.06 | 58.9 | |
| IDBackbone=Llama-3.1-8B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 58.4 | |
| PCCoTModel=LLaMA-3.2-1B, Explicit CoT=false2026.06 | 57.7 | |
| NoCoTModel=LLaMA-3.2-3B, Explicit CoT=false2026.06 | 56.9 | |
| PartitionSelBackbone=Llama-3.1-8B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 56.7 | |
| NoCoTModel=LLaMA-3.1-8B, Explicit CoT=false2026.06 | 55.3 | |
| GradNormBackbone=Llama-3.1-8B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 54.1 | |
| KAVAModel=Qwen2.5-0.5B, Explicit CoT=false2026.06 | 50.6 | |
| COCONUTModel=LLaMA-3.2-1B, Explicit CoT=false2026.06 | 48.8 | |
| CODIModel=Qwen2.5-0.5B, Explicit CoT=false2026.06 | 47 | |
| NoCoTModel=LLaMA-3.2-1B, Explicit CoT=false2026.06 | 44.1 | |
| iCoTModel=LLaMA-3.2-1B, Explicit CoT=false2026.06 | 40.9 | |
| NoCoTModel=Qwen2.5-0.5B, Explicit CoT=false2026.06 | 34.5 | |
| PCCOTModel=Qwen2.5-0.5B, Explicit CoT=false2026.06 | 33 | |
| BaselineBackbone=LLaMA-3B2026.06 | 1.67 |