Coding on TheoremQA
55.38AccuracyInfiGFusion
Evaluation Results
| Method | Links | |
|---|---|---|
| InfiGFusionModel Size=14B, GPU Hour=1952025.05 | 55.38 | |
| InfiFusionModel Size=14B, GPU Hour=1602025.05 | 54.62 | |
| Pivot-SFTModel Size=14B, GPU Hour=1202025.05 | 54.5 | |
| FuseLLMModel Size=14B, GPU Hour=2252025.05 | 53.52 | |
| FuseChatModel Size=14B, GPU Hour=6502025.05 | 51.88 | |
| Phi-4Model Size=14B, GPU Hour=∼1.0M2025.05 | 51.12 | |
| Mistral-SmallModel Size=24B, GPU Hour=∼1.6M2025.05 | 48.5 | |
| Qwen2.5-InstructModel Size=14B, GPU Hour=∼1.8M2025.05 | 47.25 | |
| MiniLogitModel Size=14B, GPU Hour=2202025.05 | 46.36 | |
| Qwen2.5-CoderModel Size=14B, GPU Hour=∼1.8M2025.05 | 38.88 |