Reasoning on AIME
73.33AIME ScoreDeepSeek-R1-Distill-Qwen-32B (Reasoning)
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepSeek-R1-Distill-Qwen-32B (Reasoning)Model Family=Qwen2.5-32B2026.01 | 73.33 | |
| DeepSeek-R1-Distill-Qwen-14B (Reasoning)Model Family=Qwen2.5-14B2026.01 | 63.33 | |
| ReasonAnyModel Family=Qwen2.5-32B2026.01 | 56.67 | |
| ReasonAnyModel Family=Qwen2.5-14B2026.01 | 46.67 | |
| Task ArithmeticModel Family=Qwen2.5-14B2026.01 | 36.67 | |
| TIESModel Family=Qwen2.5-32B2026.01 | 33.33 | |
| ReasoningBase Model=Llama-3.1-8B2026.01 | 33.33 | |
| Task ArithmeticModel Family=Qwen2.5-32B2026.01 | 30 | |
| LEDModel Family=Qwen2.5-14B2026.01 | 30 | |
| Qwen2.5-32B-Instruct (Safety)Model Family=Qwen2.5-32B2026.01 | 23.33 | |
| DAREModel Family=Qwen2.5-32B2026.01 | 23.33 | |
| FuseLLMModel Family=Qwen2.5-32B2026.01 | 23.33 | |
| LEDModel Family=Qwen2.5-32B2026.01 | 20 | |
| Qwen2.5-14B-Instruct (Safety)Model Family=Qwen2.5-14B2026.01 | 20 | |
| LinearModel Family=Qwen2.5-32B2026.01 | 16.67 | |
| DAREModel Family=Qwen2.5-14B2026.01 | 16.67 | |
| ReasonAnyMerging Protocol=ReasonAny2026.01 | 13.33 | |
| LinearModel Family=Qwen2.5-14B2026.01 | 13.33 | |
| FuseLLMModel Family=Qwen2.5-14B2026.01 | 10 | |
| LinearMerging Protocol=Linear2026.01 | 6.67 | |
| TIESMerging Protocol=TIES2026.01 | 6.67 | |
| TIESModel Family=Qwen2.5-14B2026.01 | 6.67 | |
| SafetyBase Model=Llama-3.1-8B2026.01 | 0 | |
| Task ArithmeticMerging Protocol=Task Arithmetic2026.01 | 0 | |
| DAREMerging Protocol=DARE2026.01 | 0 | |
| FuseLLMMerging Protocol=FuseLLM2026.01 | 0 | |
| LEDMerging Protocol=LED2026.01 | 0 |