Mathematical Reasoning on MATH OOD
80.2AccuracyGPT-4.5
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4.52026.06 | 80.2 | |
| IGA (Ours)2026.06 | 71.6 | |
| Pareto-GS2026.06 | 65.8 | |
| SAND-Mask2026.06 | 62.9 | |
| PCGrad2026.06 | 61.8 | |
| V-REx2026.06 | 61.3 | |
| IRM2026.06 | 60.8 | |
| ERM-SFT2026.06 | 58.4 | |
| CoT-Distill2026.06 | 57.9 | |
| LoRA-SFT2026.06 | 57.3 | |
| OGERBackbone=Qwen2.5-Math-7B2026.04 | 51.61 | |
| LuffyBackbone=Qwen2.5-Math-7B2026.04 | 51.33 | |
| OGERBackbone=Qwen2.5-Math-1.5B2026.04 | 37.7 | |
| SFT+GRPOBackbone=Qwen-2.5-0.5B, Fine-tuning strategy=Full2026.01 | 34.53 | |
| LuffyBackbone=Qwen2.5-Math-1.5B2026.04 | 33.07 | |
| SAPO-iter3Backbone=Qwen-2.5-0.5B, Fine-tuning strategy=Full2026.01 | 31.72 | |
| SAPO-iter2Backbone=Qwen-2.5-0.5B, Fine-tuning strategy=Full2026.01 | 31.48 | |
| GRPOBackbone=Qwen2.5-Math-7B2026.04 | 31.21 | |
| SAPO-iter1Backbone=Qwen-2.5-0.5B, Fine-tuning strategy=Full2026.01 | 30.04 | |
| Online-RFTBackbone=Qwen-2.5-0.5B, Fine-tuning strategy=Full2026.01 | 28.85 | |
| RFTBackbone=Qwen-2.5-0.5B, Fine-tuning strategy=Full2026.01 | 27.35 | |
| BaseBackbone=Qwen2.5-Math-7B2026.04 | 26.28 | |
| CoTBackbone=Qwen-2.5-0.5B, Fine-tuning strategy=Full2026.01 | 25.97 | |
| SFTBackbone=Qwen-2.5-0.5B, Fine-tuning strategy=Full2026.01 | 24.84 | |
| Online-RFTBackbone=Gemma-2-2B, Fine-tuning strategy=QLoRA2026.01 | 24.6 | |
| SFT+GRPOBackbone=Gemma-2-2B, Fine-tuning strategy=QLoRA2026.01 | 24.36 | |
| SAPO-iter2Backbone=Gemma-2-2B, Fine-tuning strategy=QLoRA2026.01 | 24.36 | |
| SAPO-iter3Backbone=Gemma-2-2B, Fine-tuning strategy=QLoRA2026.01 | 24.24 | |
| SAPO-iter1Backbone=Gemma-2-2B, Fine-tuning strategy=QLoRA2026.01 | 24 | |
| RPOBackbone=Qwen-2.5-0.5B, Fine-tuning strategy=Full2026.01 | 22.68 | |
| RFTBackbone=Gemma-2-2B, Fine-tuning strategy=QLoRA2026.01 | 22.14 | |
| BaseBackbone=Qwen2.5-Math-1.5B2026.04 | 21.32 | |
| SFTBackbone=Gemma-2-2B, Fine-tuning strategy=QLoRA2026.01 | 20.95 | |
| CoTBackbone=Gemma-2-2B, Fine-tuning strategy=QLoRA2026.01 | 16.22 | |
| RFT+DPOBackbone=Gemma-2-2B, Fine-tuning strategy=QLoRA2026.01 | 15.38 | |
| GRPOBackbone=Qwen2.5-Math-1.5B2026.04 | 15.37 | |
| RFT+DPOBackbone=Qwen-2.5-0.5B, Fine-tuning strategy=Full2026.01 | 12.45 | |
| RPOBackbone=Gemma-2-2B, Fine-tuning strategy=QLoRA2026.01 | 11.96 | |
| SFT+GRPOBackbone=Llama-3.2-1B, Fine-tuning strategy=Full2026.01 | 5.92 | |
| SAPO-iter2Backbone=Llama-3.2-1B, Fine-tuning strategy=Full2026.01 | 5.92 | |
| RFTBackbone=Llama-3.2-1B, Fine-tuning strategy=Full2026.01 | 5.56 | |
| SAPO-iter1Backbone=Llama-3.2-1B, Fine-tuning strategy=Full2026.01 | 5.51 | |
| Online-RFTBackbone=Llama-3.2-1B, Fine-tuning strategy=Full2026.01 | 5.45 | |
| SAPO-iter3Backbone=Llama-3.2-1B, Fine-tuning strategy=Full2026.01 | 5.45 | |
| RPOBackbone=Llama-3.2-1B, Fine-tuning strategy=Full2026.01 | 4.85 | |
| RFT+DPOBackbone=Llama-3.2-1B, Fine-tuning strategy=Full2026.01 | 4.06 | |
| CoTBackbone=Llama-3.2-1B, Fine-tuning strategy=Full2026.01 | 3.65 | |
| SFTBackbone=Llama-3.2-1B, Fine-tuning strategy=Full2026.01 | 2.6 |