Mathematical Reasoning on GSM8K (val)
90.8AccuracyOBLR-PO
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| OBLR-POModel=Qwen3-8B-Base2025.11 | 90.8 | — | — | — | — | — | — | |
| GRPOModel=Qwen3-8B-Base2025.11 | 90.4 | — | — | — | — | — | — | |
| ReMaxModel=Qwen3-8B-Base2025.11 | 89.3 | — | — | — | — | — | — | |
| RLOOModel=Qwen3-8B-Base2025.11 | 89 | — | — | — | — | — | — | |
| OBLR-POModel=Qwen3-4B-Base2025.11 | 88.6 | — | — | — | — | — | — | |
| GRPOModel=Qwen3-4B-Base2025.11 | 88.3 | — | — | — | — | — | — | |
| ReMaxModel=Qwen3-4B-Base2025.11 | 88 | — | — | — | — | — | — | |
| RLOOModel=Qwen3-4B-Base2025.11 | 87.7 | — | — | — | — | — | — | |
| PPOModel=Qwen3-8B-Base2025.11 | 87 | — | — | — | — | — | — | |
| PPOModel=Qwen3-4B-Base2025.11 | 86.7 | — | — | — | — | — | — | |
| PiSSAModel=Gemma-7B, Params=400M2026.02 | 77.78 | — | — | — | — | — | — | |
| LoRAModel=Gemma-7B, Params=400M2026.02 | 75.11 | — | — | — | — | — | — | |
| PiSSA + OursModel=Gemma-7B, Params=200M2026.02 | 74.83 | — | — | — | — | — | — | |
| LoRA + OursModel=Gemma-7B, Params=200M2026.02 | 74.58 | — | — | — | — | — | — | |
| PiSSAModel=Mistral-7B, Params=335M2026.02 | 73.31 | — | — | — | — | — | — | |
| LoRA + OursModel=Mistral-7B, Params=167M2026.02 | 72.76 | — | — | — | — | — | — | |
| PiSSA + OursModel=Mistral-7B, Params=167M2026.02 | 72.66 | — | — | — | — | — | — | |
| Full FTModel=Gemma-7B, Params=8540M2026.02 | 72.09 | — | — | — | — | — | — | |
| Full FTModel=Mistral-7B, Params=7240M2026.02 | 69.91 | — | — | — | — | — | — | |
| LoRAModel=Mistral-7B, Params=335M2026.02 | 69.5 | — | — | — | — | — | — | |
| G2ISBackbone=Gemma-7B, Prompting=COT, Selection Ratio=1%2025.02 | 62.93 | — | — | — | — | — | — | |
| G2ISBackbone=Gemma-7B, Prompting=FLAN, Selection Ratio=1%2025.02 | 62.32 | — | — | — | — | — | — | |
| G2ISBackbone=Llama3.1-8B, Prompting=COT, Selection Ratio=5%2025.02 | 60.88 | — | — | — | — | — | — | |
| Full Dataset TuningBackbone=Llama3.1-8B, Prompting=COT, Selection Ratio=100%2025.02 | 60.58 | — | — | — | — | — | — | |
| Full Dataset TuningBackbone=Gemma-7B, Prompting=COT, Selection Ratio=100%2025.02 | 60.35 | — | — | — | — | — | — | |
| G2ISBackbone=Llama3.1-8B, Prompting=COT, Selection Ratio=1%2025.02 | 60.12 | — | — | — | — | — | — | |
| LESSBackbone=Gemma-7B, Prompting=COT, Selection Ratio=1%2025.02 | 60.05 | — | — | — | — | — | — | |
| G2ISBackbone=Gemma-7B, Prompting=FLAN, Selection Ratio=5%2025.02 | 59.97 | — | — | — | — | — | — | |
| G2ISBackbone=Gemma-7B, Prompting=COT, Selection Ratio=5%2025.02 | 59.29 | — | — | — | — | — | — | |
| BERTBackbone=Llama3.1-8B, Prompting=COT, Selection Ratio=5%2025.02 | 59.21 | — | — | — | — | — | — | |
| G2ISBackbone=Llama3.1-8B, Prompting=FLAN, Selection Ratio=1%2025.02 | 58.98 | — | — | — | — | — | — | |
| LESSBackbone=Llama3.1-8B, Prompting=COT, Selection Ratio=1%2025.02 | 58.91 | — | — | — | — | — | — | |
| BERTBackbone=Gemma-7B, Prompting=COT, Selection Ratio=5%2025.02 | 58.38 | — | — | — | — | — | — | |
| G2ISBackbone=Llama3.1-8B, Prompting=FLAN, Selection Ratio=5%2025.02 | 57.85 | — | — | — | — | — | — | |
| LESSBackbone=Llama3.1-8B, Prompting=COT, Selection Ratio=5%2025.02 | 57.16 | — | — | — | — | — | — | |
| LESSBackbone=Gemma-7B, Prompting=COT, Selection Ratio=5%2025.02 | 56.48 | — | — | — | — | — | — | |
| BERTBackbone=Llama3.1-8B, Prompting=COT, Selection Ratio=1%2025.02 | 55.88 | — | — | — | — | — | — | |
| BA-LoRAPEFT Method=BA-LoRA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 55.86 | — | — | — | — | — | — | |
| CorDA++PEFT Method=CorDA++, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 55.03 | — | — | — | — | — | — | |
| PiSSA + OursModel=LLaMA 2-7B, Params=159M2026.02 | 54.79 | — | — | — | — | — | — | |
| CorDAPEFT Method=CorDA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 53.9 | — | — | — | — | — | — | |
| LESSBackbone=Llama3.1-8B, Prompting=FLAN, Selection Ratio=1%2025.02 | 53.53 | — | — | — | — | — | — | |
| LESSBackbone=Gemma-7B, Prompting=FLAN, Selection Ratio=1%2025.02 | 53.53 | — | — | — | — | — | — | |
| PiSSAModel=LLaMA 2-7B, Params=320M2026.02 | 53.22 | — | — | — | — | — | — | |
| BERTBackbone=Gemma-7B, Prompting=FLAN, Selection Ratio=1%2025.02 | 53.15 | — | — | — | — | — | — | |
| BERTBackbone=Llama3.1-8B, Prompting=FLAN, Selection Ratio=1%2025.02 | 52.16 | — | — | — | — | — | — | |
| BERTBackbone=Gemma-7B, Prompting=COT, Selection Ratio=1%2025.02 | 51.78 | — | — | — | — | — | — | |
| Full Dataset TuningBackbone=Mistral-7B, Prompting=COT, Selection Ratio=100%2025.02 | 51.78 | — | — | — | — | — | — | |
| Full Dataset TuningBackbone=Llama3.1-8B, Prompting=FLAN, Selection Ratio=100%2025.02 | 51.71 | — | — | — | — | — | — | |
| PiSSAPEFT Method=PiSSA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 51.48 | — | — | — | — | — | — | |
| LESSBackbone=Gemma-7B, Prompting=FLAN, Selection Ratio=5%2025.02 | 51.1 | — | — | — | — | — | — | |
| BERTBackbone=Gemma-7B, Prompting=FLAN, Selection Ratio=5%2025.02 | 50.57 | — | — | — | — | — | — | |
| LoRA-GAPEFT Method=LoRA-GA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 50.47 | — | — | — | — | — | — | |
| BERTBackbone=Llama3.1-8B, Prompting=FLAN, Selection Ratio=5%2025.02 | 50.27 | — | — | — | — | — | — | |
| LoCOConfig=n=1, r=16, %Param=0.122026.05 | 50.19 | — | — | — | — | — | — | |
| HRAConfig=r=32, %Param=0.122026.05 | 50.04 | — | — | — | — | — | — | |
| G2ISBackbone=Mistral-7B, Prompting=COT, Selection Ratio=1%2025.02 | 49.51 | — | — | — | — | — | — | |
| EvoGMBackbone=Qwen2.5-1.5B2026.05 | 49.5 | — | — | — | — | — | — | |
| Full Dataset TuningBackbone=Gemma-7B, Prompting=FLAN, Selection Ratio=100%2025.02 | 49.43 | — | — | — | — | — | — | |
| OFTConfig=b=64, %Param=0.122026.05 | 49.35 | — | — | — | — | — | — | |
| Full FTModel=LLaMA 2-7B, Params=6738M2026.02 | 49.13 | — | — | — | — | — | — | |
| PSO-MergingBackbone=Qwen2.5-1.5B2026.05 | 49 | — | — | — | — | — | — | |
| Full FTPEFT Method=Full Fine-tuning, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 48.9 | — | — | — | — | — | — | |
| LoRA+PEFT Method=LoRA+, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 47.84 | — | — | — | — | — | — | |
| LoRA + OursModel=LLaMA 2-7B, Params=159M2026.02 | 47.28 | — | — | — | — | — | — | |
| G2ISBackbone=Mistral-7B, Prompting=COT, Selection Ratio=5%2025.02 | 47.08 | — | — | — | — | — | — | |
| BERTBackbone=Mistral-7B, Prompting=COT, Selection Ratio=5%2025.02 | 46.7 | — | — | — | — | — | — | |
| LESSBackbone=Llama3.1-8B, Prompting=FLAN, Selection Ratio=5%2025.02 | 46.55 | — | — | — | — | — | — | |
| G2ISBackbone=Mistral-7B, Prompting=FLAN, Selection Ratio=5%2025.02 | 46.4 | — | — | — | — | — | — | |
| BOFTConfig=m=2, b=8, %Param=0.132026.05 | 45.58 | — | — | — | — | — | — | |
| LESSBackbone=Mistral-7B, Prompting=COT, Selection Ratio=5%2025.02 | 45.03 | — | — | — | — | — | — | |
| LESSBackbone=Mistral-7B, Prompting=COT, Selection Ratio=1%2025.02 | 44.73 | — | — | — | — | — | — | |
| Pioneer Agent (Llama 3.2-3B)Model=Llama 3.2-3B, Evaluation Protocol=Fine-tuned, Iters=102026.04 | 43.7 | — | — | — | — | 35.7 | — | |
| G2ISBackbone=Mistral-7B, Prompting=FLAN, Selection Ratio=1%2025.02 | 43.44 | — | — | — | — | — | — | |
| MiLoRAPEFT Method=MiLoRA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 43.09 | — | — | — | — | — | — | |
| CMABackbone=Qwen2.5-1.5B2026.05 | 43 | — | — | — | — | — | — | |
| LoRAModel=LLaMA 2-7B, Params=320M2026.02 | 42.85 | — | — | — | — | — | — | |
| LoRAPEFT Method=LoRA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 42.68 | — | — | — | — | — | — | |
| AdaLoRAPEFT Method=AdaLoRA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 41.95 | — | — | — | — | — | — | |
| DoRAPEFT Method=DoRA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 41.77 | — | — | — | — | — | — | |
| Model SwarmBackbone=Qwen2.5-1.5B2026.05 | 41 | — | — | — | — | — | — | |
| LoRA-FAPEFT Method=LoRA-FA, Base Model=LLaMA-2-7B, Fine-tuning Dataset=MetaMathQA2024.08 | 40.25 | — | — | — | — | — | — | |
| LESSBackbone=Mistral-7B, Prompting=FLAN, Selection Ratio=1%2025.02 | 39.95 | — | — | — | — | — | — | |
| Single BestBase model=Qwen2.5-1.5B2026.05 | 39.5 | — | — | — | — | — | — | |
| Single BestBackbone=Qwen2.5-1.5B2026.05 | 39.5 | — | — | — | — | — | — | |
| BERTBackbone=Mistral-7B, Prompting=COT, Selection Ratio=1%2025.02 | 39.2 | — | — | — | — | — | — | |
| BERTBackbone=Mistral-7B, Prompting=FLAN, Selection Ratio=1%2025.02 | 37.53 | — | — | — | — | — | — | |
| Model SwarmBase model=Qwen2.5-1.5B2026.05 | 37.5 | — | — | — | — | — | — | |
| MTLBase model=Qwen2.5-1.5B2026.05 | 36.5 | — | — | — | — | — | — | |
| MTLBackbone=Qwen2.5-1.5B2026.05 | 36.5 | — | — | — | — | — | — | |
| Full Dataset TuningBackbone=Mistral-7B, Prompting=FLAN, Selection Ratio=100%2025.02 | 35.63 | — | — | — | — | — | — | |
| BERTBackbone=Mistral-7B, Prompting=FLAN, Selection Ratio=5%2025.02 | 35.1 | — | — | — | — | — | — | |
| Task ArithmeticBase model=Qwen2.5-1.5B2026.05 | 35 | — | — | — | — | — | — | |
| EvoGMBase model=Qwen2.5-1.5B2026.05 | 35 | — | — | — | — | — | — | |
| TABackbone=Qwen2.5-1.5B2026.05 | 35 | — | — | — | — | — | — | |
| MGUP-AdamWModel=LLaMA2-7B, Evaluation Protocol=Fine-tuning2026.06 | 34.96 | — | — | — | — | — | — | |
| LDAdamWModel=LLaMA2-7B, Evaluation Protocol=Fine-tuning, rank=5122026.06 | 34.88 | — | — | — | — | — | — | |
| C-AdamWModel=LLaMA2-7B, Evaluation Protocol=Fine-tuning2026.06 | 34.68 | — | — | — | — | — | — | |
| GALoreModel=LLaMA2-7B, Evaluation Protocol=Fine-tuning, rank=5122026.06 | 34.62 | — | — | — | — | — | — | |
| MicroAdamWModel=LLaMA2-7B, Evaluation Protocol=Fine-tuning, m=102026.06 | 34.58 | — | — | — | — | — | — |