Mathematical Reasoning on MATH (val)
41.6AccuracyEVPO
Evaluation Results
| Method | Links | |
|---|---|---|
| EVPOBackbone=Qwen2.5-7B-Instruct2026.04 | 41.6 | |
| DAPOBackbone=Qwen2.5-7B-Instruct, Method Category=Critic-free2026.04 | 38.5 | |
| GRPOBackbone=Qwen2.5-7B-Instruct, Method Category=Critic-free2026.04 | 37.9 | |
| PPOBackbone=Qwen2.5-7B-Instruct, Method Category=Critic-based2026.04 | 37.3 | |
| StarPO-SBackbone=Qwen2.5-7B-Instruct, Method Category=Critic-based2026.04 | 37.1 | |
| Base LLMBackbone=Qwen2.5-7B-Instruct, Method Category=None2026.04 | 33.2 | |
| TAIATraining Dataset=Alpaca-GPT4, Model=LLaMA3-8B, FT Method=LoRA, Infer Mode=TAIA2024.05 | 28.34 | |
| TAIATraining Dataset=Alpaca-GPT4, Model=LLaMA3-8B, FT Method=MOLORA, Infer Mode=TAIA2024.05 | 28.16 | |
| LLaMA3-8BTraining Dataset=Base Model, Model=LLaMA3-8B2024.05 | 27.92 | |
| TAIATraining Dataset=CoT-Collection, Model=LLaMA3-8B, FT Method=LoRA, Infer Mode=TAIA2024.05 | 26.28 | |
| TAIATraining Dataset=CoT-Collection, Model=LLaMA3-8B, FT Method=MOLORA, Infer Mode=TAIA2024.05 | 25.46 | |
| MOLORATraining Dataset=Alpaca-GPT4, Model=LLaMA3-8B, FT Method=MOLORA, Infer Mode=Vanilla2024.05 | 25.38 | |
| LoRATraining Dataset=Alpaca-GPT4, Model=LLaMA3-8B, FT Method=LoRA, Infer Mode=Vanilla2024.05 | 25.26 | |
| TAIATraining Dataset=Alpaca-GPT4, Model=Qwen1.5-7B, FT Method=MOLORA, Infer Mode=TAIA2024.05 | 25.04 | |
| TAIATraining Dataset=Alpaca-GPT4, Model=Qwen1.5-7B, FT Method=LoRA, Infer Mode=TAIA2024.05 | 24.98 | |
| Qwen1.5-7BTraining Dataset=Base Model, Model=Qwen1.5-7B2024.05 | 20.3 | |
| TAIATraining Dataset=CoT-Collection, Model=Qwen1.5-7B, FT Method=LoRA, Infer Mode=TAIA2024.05 | 20.28 | |
| TAIATraining Dataset=CoT-Collection, Model=Qwen1.5-7B, FT Method=MOLORA, Infer Mode=TAIA2024.05 | 19.74 | |
| MOLORATraining Dataset=Alpaca-GPT4, Model=Qwen1.5-7B, FT Method=MOLORA, Infer Mode=Vanilla2024.05 | 18.12 | |
| LoRATraining Dataset=Alpaca-GPT4, Model=Qwen1.5-7B, FT Method=LoRA, Infer Mode=Vanilla2024.05 | 17.9 | |
| MOLORATraining Dataset=CoT-Collection, Model=LLaMA3-8B, FT Method=MOLORA, Infer Mode=Vanilla2024.05 | 17.7 | |
| LoRATraining Dataset=CoT-Collection, Model=LLaMA3-8B, FT Method=LoRA, Infer Mode=Vanilla2024.05 | 16.12 | |
| MOLORATraining Dataset=CoT-Collection, Model=Qwen1.5-7B, FT Method=MOLORA, Infer Mode=Vanilla2024.05 | 13.38 | |
| LoRATraining Dataset=CoT-Collection, Model=Qwen1.5-7B, FT Method=LoRA, Infer Mode=Vanilla2024.05 | 13.22 | |
| TAIATraining Dataset=Alpaca-GPT4, Model=Qwen1.5-1.8B, FT Method=LoRA, Infer Mode=TAIA2024.05 | 10.82 | |
| TAIATraining Dataset=Alpaca-GPT4, Model=Qwen1.5-1.8B, FT Method=MOLORA, Infer Mode=TAIA2024.05 | 10.2 | |
| TAIATraining Dataset=CoT-Collection, Model=Qwen1.5-1.8B, FT Method=LoRA, Infer Mode=TAIA2024.05 | 9.64 | |
| BA-LoRAPEFT Method=BA-LoRA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 9.47 | |
| TAIATraining Dataset=CoT-Collection, Model=Qwen1.5-1.8B, FT Method=MOLORA, Infer Mode=TAIA2024.05 | 9.08 | |
| CorDA++PEFT Method=CorDA++, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 8.95 | |
| TAIATraining Dataset=Alpaca-GPT4, Model=LLaMA2-7B, FT Method=MOLORA, Infer Mode=TAIA2024.05 | 8.82 | |
| CorDAPEFT Method=CorDA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 8.52 | |
| MOLORATraining Dataset=Alpaca-GPT4, Model=Qwen1.5-1.8B, FT Method=MOLORA, Infer Mode=Vanilla2024.05 | 8.44 | |
| TAIATraining Dataset=CoT-Collection, Model=LLaMA2-7B, FT Method=LoRA, Infer Mode=TAIA2024.05 | 8.44 | |
| LoCOConfig=n=1, r=16, %Param=0.122026.05 | 8.4 | |
| OFTConfig=b=64, %Param=0.122026.05 | 8.39 | |
| LLaMA2-7BTraining Dataset=Base Model, Model=LLaMA2-7B2024.05 | 8.22 | |
| TAIATraining Dataset=CoT-Collection, Model=LLaMA2-7B, FT Method=MOLORA, Infer Mode=TAIA2024.05 | 8.04 | |
| LoRATraining Dataset=Alpaca-GPT4, Model=Qwen1.5-1.8B, FT Method=LoRA, Infer Mode=Vanilla2024.05 | 8.02 | |
| TAIATraining Dataset=Alpaca-GPT4, Model=LLaMA2-7B, FT Method=LoRA, Infer Mode=TAIA2024.05 | 8.02 | |
| LoRATraining Dataset=CoT-Collection, Model=LLaMA2-7B, FT Method=LoRA, Infer Mode=Vanilla2024.05 | 7.98 | |
| MOLORATraining Dataset=CoT-Collection, Model=Qwen1.5-1.8B, FT Method=MOLORA, Infer Mode=Vanilla2024.05 | 7.9 | |
| LoRATraining Dataset=CoT-Collection, Model=Qwen1.5-1.8B, FT Method=LoRA, Infer Mode=Vanilla2024.05 | 7.68 | |
| PiSSAPEFT Method=PiSSA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 7.6 | |
| Full FTPEFT Method=Full Fine-tuning, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 7.48 | |
| HRAConfig=r=32, %Param=0.122026.05 | 7.45 | |
| MOLORATraining Dataset=Alpaca-GPT4, Model=LLaMA2-7B, FT Method=MOLORA, Infer Mode=Vanilla2024.05 | 7.42 | |
| LoRA+PEFT Method=LoRA+, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 7.21 | |
| LoRA-GAPEFT Method=LoRA-GA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 7.13 | |
| LoRATraining Dataset=Alpaca-GPT4, Model=LLaMA2-7B, FT Method=LoRA, Infer Mode=Vanilla2024.05 | 7.08 | |
| BOFTConfig=m=2, b=8, %Param=0.132026.05 | 6.85 | |
| MiLoRAPEFT Method=MiLoRA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 6.31 | |
| AdaLoRAPEFT Method=AdaLoRA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 6.24 | |
| DoRAPEFT Method=DoRA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 6.2 | |
| LoRAPEFT Method=LoRA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 5.92 | |
| LoRA-FAPEFT Method=LoRA-FA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 5.66 | |
| MOLORATraining Dataset=CoT-Collection, Model=LLaMA2-7B, FT Method=MOLORA, Infer Mode=Vanilla2024.05 | 4.54 | |
| Qwen1.5-1.8BTraining Dataset=Base Model, Model=Qwen1.5-1.8B2024.05 | 4.28 | |
| Llama-2-7B2026.05 | 2.5 |