Grade School Math Word Problem Solving on GSM8K (test)
78.92AccuracyMetaTuner-J
Evaluation Results
| Method | Links | |
|---|---|---|
| MetaTuner-JBackbone=Qwen2.5-7B, Method Category=Hybrid2025.09 | 78.92 | |
| MetaTuner-IBackbone=Qwen2.5-7B, Method Category=Hybrid2025.09 | 78.54 | |
| OPROBackbone=Qwen2.5-7B, Method Category=Prompt Optimization2025.09 | 75.06 | |
| MetaTuner-IBackbone=Qwen2.5-3B, Method Category=Hybrid2025.09 | 73.46 | |
| MetaTuner-JBackbone=Qwen2.5-3B, Method Category=Hybrid2025.09 | 73.08 | |
| BetterTogetherBackbone=Qwen2.5-7B, Method Category=Hybrid2025.09 | 67.93 | |
| BetterTogetherBackbone=Qwen2.5-3B, Method Category=Hybrid2025.09 | 66.8 | |
| DPOBackbone=Qwen2.5-7B, Method Category=Fine-Tuning2025.09 | 63.68 | |
| OPROBackbone=Qwen2.5-3B, Method Category=Prompt Optimization2025.09 | 62.62 | |
| KTOBackbone=Qwen2.5-7B, Method Category=Fine-Tuning2025.09 | 62.47 | |
| PPOBackbone=Qwen2.5-7B, Method Category=Fine-Tuning2025.09 | 62.02 | |
| SFTBackbone=Qwen2.5-7B, Method Category=Fine-Tuning2025.09 | 61.41 | |
| DPOBackbone=Qwen2.5-3B, Method Category=Fine-Tuning2025.09 | 60.42 | |
| BPOBackbone=Qwen2.5-7B, Method Category=Prompt Optimization2025.09 | 58 | |
| KTOBackbone=Qwen2.5-3B, Method Category=Fine-Tuning2025.09 | 57.7 | |
| MFTBase Model=Llama2-13B2024.03 | 56.2 | |
| SFTBackbone=Qwen2.5-3B, Method Category=Fine-Tuning2025.09 | 56.18 | |
| PPOBackbone=Qwen2.5-3B, Method Category=Fine-Tuning2025.09 | 55.95 | |
| CFPOBackbone=Qwen2.5-7B, Method Category=Prompt Optimization2025.09 | 55.64 | |
| CFPOBackbone=Qwen2.5-3B, Method Category=Prompt Optimization2025.09 | 55.27 | |
| RFT-100Base Model=Llama2-13B2024.03 | 55.2 | |
| BPOBackbone=Qwen2.5-3B, Method Category=Prompt Optimization2025.09 | 53.9 | |
| RLPromptBackbone=Qwen2.5-7B, Method Category=Prompt Optimization2025.09 | 53.15 | |
| SFTBase Model=Llama2-13B2024.03 | 52.7 | |
| Qwen2.5Backbone=Qwen2.5-7B, Method Category=Vanilla2025.09 | 51.63 | |
| Qwen2.5Backbone=Qwen2.5-3B, Method Category=Vanilla2025.09 | 49.36 | |
| RFT-100Base Model=Llama2-7B2024.03 | 47.6 | |
| MFTBase Model=Llama2-7B2024.03 | 47.1 | |
| RLPromptBackbone=Qwen2.5-3B, Method Category=Prompt Optimization2025.09 | 45.94 | |
| Trans-LoRASource Model=Gemma-2b, Target Model=Gemma-7b, Discriminator Model=Gemma-2b, Chain-of-thought=false2024.05 | 44.58 | |
| Trans-LoRASource Model=Llama-2-7b, Target Model=Gemma-7b, Discriminator Model=Gemma-2b, Chain-of-thought=false2024.05 | 42.3 | |
| Trans-LoRASource Model=Llama-2-7b, Target Model=Gemma-7b, Discriminator Model=Llama-2-7b, Chain-of-thought=false2024.05 | 41.62 | |
| SFTBase Model=Llama2-7B2024.03 | 41.6 | |
| Gemma-7b (Base)Model=Gemma-7b, Configuration=No LoRA, Chain-of-thought=false2024.05 | 40.64 | |
| Trans-LoRASource Model=Llama-2-7b, Target Model=Llama-2-13b, Discriminator Model=Llama-2-7b, Chain-of-thought=false2024.05 | 30.7 | |
| Llama-2-13b (Base)Model=Llama-2-13b, Configuration=No LoRA, Chain-of-thought=false2024.05 | 28.86 | |
| Llama-2-7b (LoRA)Model=Llama-2-7b, Configuration=Fine-tuned with LoRA, Chain-of-thought=false2024.05 | 19.64 | |
| Gemma-2b (LoRA)Model=Gemma-2b, Configuration=Fine-tuned with LoRA, Chain-of-thought=false2024.05 | 14.94 |