Mathematical Reasoning on AIME 2024 (Accuracy %)
83.33AIME 2024 AccuracyOriginal
Evaluation Results
| Method | Links | |
|---|---|---|
| OriginalModel=Seed-OSS-36B-Instruct, MLP Sparsity=0%2026.06 | 83.33 | |
| SpenseGPT+Model=Seed-OSS-36B-Instruct, MLP Sparsity=25%2026.06 | 80 | |
| SpenseGPTModel=Seed-OSS-36B-Instruct, MLP Sparsity=37.5%2026.06 | 78.89 | |
| SpenseGPT+Model=Qwen3-32B, MLP Sparsity=37.5%2026.06 | 77.78 | |
| SpenseGPTModel=Seed-OSS-36B-Instruct, MLP Sparsity=25%2026.06 | 77.78 | |
| SpenseGPT+Model=Qwen3-32B, MLP Sparsity=25%2026.06 | 76.67 | |
| SpenseGPT+Model=Seed-OSS-36B-Instruct, MLP Sparsity=37.5%2026.06 | 76.67 | |
| OriginalModel=Qwen3-32B, MLP Sparsity=0%2026.06 | 75.56 | |
| SparseGPTModel=Seed-OSS-36B-Instruct, MLP Sparsity=50%2026.06 | 75.56 | |
| SpenseGPTModel=Qwen3-32B, MLP Sparsity=37.5%2026.06 | 73.33 | |
| SpenseGPTModel=Qwen3-32B, MLP Sparsity=25%2026.06 | 71.11 | |
| SparseGPTModel=Qwen3-32B, MLP Sparsity=50%2026.06 | 68.89 | |
| Text-SerializationBackbone=Qwen3-14B, Workers=32026.06 | 63.33 | |
| Parallel-SynthesisBackbone=Qwen3-14B, Workers=3, Merging=Weighted averaging (lambda=0.5)2026.06 | 63.33 | |
| BaseModel backbone=Qwen3-4B-It, Fine-tuning method=Base2026.05 | 62.9 | |
| MCPO-DAPOBackbone=Qwen3-8B2026.05 | 59.86 | |
| MCPO-GRPOBackbone=Qwen3-8B2026.05 | 57.71 | |
| MIXSDModel backbone=Qwen3-4B-It, Fine-tuning method=MIXSD, Mixing rate λ=0.72026.05 | 56.9 | |
| MCPO-DAPOBackbone=Qwen3-4B2026.05 | 56.35 | |
| MIXSDModel backbone=Qwen3-4B-It, Fine-tuning method=MIXSD, Mixing rate λ=0.52026.05 | 55 | |
| MGSBackbone=Qwen3-8B2026.05 | 54.17 | |
| MCPO-GRPOBackbone=Qwen3-4B2026.05 | 54.15 | |
| MT-GRPOBackbone=Qwen3-8B2026.05 | 54.05 | |
| DAPOBackbone=Qwen3-4B2026.05 | 53.56 | |
| DAPOBackbone=Qwen3-8B2026.05 | 53.46 | |
| MT-GRPOBackbone=Qwen3-4B2026.05 | 52.7 | |
| GRPOBackbone=Qwen3-8B2026.05 | 51.88 | |
| CLIPOBackbone=Qwen3-8B2026.05 | 51.56 | |
| MIXSDModel backbone=Qwen3-4B-It, Fine-tuning method=MIXSD, Mixing rate λ=0.32026.05 | 51.5 | |
| MGSBackbone=Qwen3-4B2026.05 | 51.25 | |
| KVLINKBackbone=Qwen3-14B, Workers=32026.06 | 50 | |
| CLIPOBackbone=Qwen3-4B2026.05 | 48.33 | |
| GRPOBackbone=Qwen3-4B2026.05 | 48.02 | |
| MIXSDModel backbone=Qwen3-4B-It, Fine-tuning method=MIXSD, Mixing rate λ=02026.05 | 44.4 | |
| Base ModelBackbone=Qwen3-8B2026.05 | 39.89 | |
| Base ModelBackbone=Qwen3-4B2026.05 | 36.04 | |
| MIXSDModel backbone=Qwen3-8B, Fine-tuning method=MIXSD, Mixing rate λ=0.72026.05 | 32.1 | |
| VotingBackbone=Qwen3-14B, Workers=32026.06 | 30 | |
| MIXSDModel backbone=Qwen3-8B, Fine-tuning method=MIXSD, Mixing rate λ=0.52026.05 | 29 | |
| BaseModel backbone=Qwen3-8B, Fine-tuning method=Base2026.05 | 26 | |
| MIXSDModel backbone=Qwen3-8B, Fine-tuning method=MIXSD, Mixing rate λ=0.32026.05 | 24.2 | |
| SingleBackbone=Qwen3-14B, Workers=12026.06 | 23.33 | |
| MIXSDModel backbone=Qwen3-8B, Fine-tuning method=MIXSD, Mixing rate λ=02026.05 | 17.5 | |
| OPSDModel backbone=Qwen3-4B-It, Fine-tuning method=OPSD2026.05 | 15 | |
| HyperPruneModel=Qwen3-32B, MLP Sparsity=50%2026.06 | 13.33 | |
| CacheBlendBackbone=Qwen3-14B, Workers=32026.06 | 13.33 | |
| SFTModel backbone=Qwen3-8B, Fine-tuning method=SFT2026.05 | 12.3 | |
| BaseModel backbone=Qwen3-1.7B, Fine-tuning method=Base2026.05 | 11 | |
| OPSDModel backbone=Qwen3-8B, Fine-tuning method=OPSD2026.05 | 9.4 | |
| SFTModel backbone=Qwen3-4B-It, Fine-tuning method=SFT2026.05 | 6.7 | |
| WandaModel=Qwen3-32B, MLP Sparsity=50%2026.06 | 6.67 | |
| APEBackbone=Qwen3-14B, Workers=32026.06 | 6.67 | |
| MIXSDModel backbone=Qwen3-1.7B, Fine-tuning method=MIXSD, Mixing rate λ=0.52026.05 | 4.8 | |
| MIXSDModel backbone=Qwen3-1.7B, Fine-tuning method=MIXSD, Mixing rate λ=0.72026.05 | 2.3 | |
| MIXSDModel backbone=Qwen3-1.7B, Fine-tuning method=MIXSD, Mixing rate λ=0.32026.05 | 1.9 | |
| HyperPruneModel=Seed-OSS-36B-Instruct, MLP Sparsity=50%2026.06 | 1.11 | |
| SFTModel backbone=Qwen3-1.7B, Fine-tuning method=SFT2026.05 | 0.4 | |
| OPSDModel backbone=Qwen3-1.7B, Fine-tuning method=OPSD2026.05 | 0 | |
| MIXSDModel backbone=Qwen3-1.7B, Fine-tuning method=MIXSD, Mixing rate λ=02026.05 | 0 | |
| WandaModel=Seed-OSS-36B-Instruct, MLP Sparsity=50%2026.06 | 0 |