Mathematical Reasoning on TheoremQA (ThmQA)
57.88ThmQA ScoreSFT-DPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SFT-DPOModel Size=14B, GPU Hours=502025.05 | 57.88 | |
| SFT-WRPOModel Size=14B, GPU Hours=572025.05 | 57.88 | |
| InfiFPOModel Size=14B, GPU Hours=582025.05 | 57.25 | |
| InfiFPO*Model Size=14B, GPU Hours=55, Subset Source Models=true2025.05 | 57 | |
| InfiFusion*Model Size=14B, GPU Hours=160, Subset Source Models=true2025.05 | 55.62 | |
| SFT-IPOModel Size=14B, GPU Hours=502025.05 | 55.25 | |
| SFTModel Size=14B, GPU Hours=152025.05 | 55.12 | |
| FuseLLM*Model Size=14B, GPU Hours=225, Subset Source Models=true2025.05 | 53.52 | |
| FuseChat*Model Size=14B, GPU Hours=650, Subset Source Models=true2025.05 | 51.88 | |
| Phi-4Model Size=14B, GPU Hours=∼1.0M2025.05 | 51.12 | |
| Gemma-3-InstructModel Size=12B2025.05 | 49.62 | |
| Mistral-SmallModel Size=24B, GPU Hours=∼1.6M2025.05 | 48.5 | |
| Qwen2.5-InstructModel Size=14B, GPU Hours=∼1.8M2025.05 | 47.25 | |
| Qwen2.5-CoderModel Size=14B, GPU Hours=∼1.8M2025.05 | 38.88 | |
| Qwen2.5-MathModel Size=7B, GPU Hours=∼0.5M2025.05 | 20.25 |