General Reasoning on ARC Challenge (Score)
94.58ARC ScoreInfiGFusion
Evaluation Results
| Method | Links | |
|---|---|---|
| InfiGFusionModel Size=14B, GPU Hour=1952025.05 | 94.58 | |
| SFT-DPOModel Size=14B, GPU Hours=502025.05 | 94.58 | |
| InfiFusionModel Size=14B, GPU Hour=1602025.05 | 94.24 | |
| InfiFusion*Model Size=14B, GPU Hours=160, Subset Source Models=true2025.05 | 94.24 | |
| SFT-IPOModel Size=14B, GPU Hours=502025.05 | 94.24 | |
| SFT-WRPOModel Size=14B, GPU Hours=572025.05 | 94.24 | |
| InfiFPO*Model Size=14B, GPU Hours=55, Subset Source Models=true2025.05 | 94.24 | |
| InfiFPOModel Size=14B, GPU Hours=582025.05 | 94.24 | |
| Phi-4Model Size=14B, GPU Hour=∼1.0M2025.05 | 93.9 | |
| Phi-4Model Size=14B, GPU Hours=∼1.0M2025.05 | 93.9 | |
| Pivot-SFTModel Size=14B, GPU Hour=1202025.05 | 93.56 | |
| FuseChatModel Size=14B, GPU Hour=6502025.05 | 93.56 | |
| FuseChat*Model Size=14B, GPU Hours=650, Subset Source Models=true2025.05 | 93.56 | |
| SFTModel Size=14B, GPU Hours=152025.05 | 93.56 | |
| Qwen2.5-InstructModel Size=14B, GPU Hour=∼1.8M2025.05 | 92.2 | |
| Qwen2.5-InstructModel Size=14B, GPU Hours=∼1.8M2025.05 | 92.2 | |
| MiniLogitModel Size=14B, GPU Hour=2202025.05 | 92.19 | |
| FuseLLMModel Size=14B, GPU Hour=2252025.05 | 92.08 | |
| FuseLLM*Model Size=14B, GPU Hours=225, Subset Source Models=true2025.05 | 92.08 | |
| Mistral-SmallModel Size=24B, GPU Hour=∼1.6M2025.05 | 91.86 | |
| Mistral-SmallModel Size=24B, GPU Hours=∼1.6M2025.05 | 91.86 | |
| Qwen2.5-CoderModel Size=14B, GPU Hour=∼1.8M2025.05 | 89.49 | |
| Qwen2.5-CoderModel Size=14B, GPU Hours=∼1.8M2025.05 | 89.49 | |
| Task ArithmeticModel Scale=Llama-3.1-8B, Quantization Bit-width=Full-precision, Merging Algorithm=Task Arithmetic2026.05 | 77.99 | |
| AWQModel Scale=Llama-3.1-8B, Quantization Bit-width=4-bit, Merging Algorithm=Task Arithmetic2026.05 | 76.62 | |
| GPTQModel Scale=Llama-3.1-8B, Quantization Bit-width=4-bit, Merging Algorithm=Task Arithmetic2026.05 | 76.45 | |
| E-PMQModel Scale=Llama-3.1-8B, Quantization Bit-width=4-bit, Merging Algorithm=Task Arithmetic2026.05 | 76.28 | |
| Task ArithmeticModel Scale=Llama-3.1-3B, Quantization Bit-width=Full-precision, Merging Algorithm=Task Arithmetic2026.05 | 72.7 | |
| AWQModel Scale=Llama-3.1-3B, Quantization Bit-width=4-bit, Merging Algorithm=Task Arithmetic2026.05 | 72.44 | |
| Gemma-3-InstructModel Size=12B2025.05 | 71.19 | |
| E-PMQModel Scale=Llama-3.1-3B, Quantization Bit-width=4-bit, Merging Algorithm=Task Arithmetic2026.05 | 70.99 | |
| GPTQModel Scale=Llama-3.1-3B, Quantization Bit-width=4-bit, Merging Algorithm=Task Arithmetic2026.05 | 70.9 | |
| Qwen2.5-MathModel Size=7B, GPU Hours=∼0.5M2025.05 | 65.76 |