Mathematical Reasoning on AIME 2025 (Accuracy avg@16)
48.8Accuracy (avg@16)Sigma-MoE-Tiny
Evaluation Results
| Method | Links | |
|---|---|---|
| Sigma-MoE-TinyArchitecture=MoE, # Activated Params=0.5B, # Total Params=20B2025.12 | 48.8 | |
| DeepSeek-R1-Distill-Qwen-7BArchitecture=Dense, # Activated Params=7B, # Total Params=7B2025.12 | 39.2 | |
| RF++ B + ReProBackbone=Qwen3-1.7B2025.12 | 39 | |
| GRPO + ReProBackbone=Qwen3-1.7B2025.12 | 37.9 | |
| PPO + ReProBackbone=Qwen3-1.7B2025.12 | 37.5 | |
| Qwen3-1.7BArchitecture=Dense, # Activated Params=1.7B, # Total Params=1.7B2025.12 | 36.8 | |
| PPOBackbone=Qwen3-1.7B2025.12 | 36.5 | |
| OriginalBackbone=Qwen3-1.7B2025.12 | 36.1 | |
| GRPOBackbone=Qwen3-1.7B2025.12 | 34.8 | |
| RF++ BBackbone=Qwen3-1.7B2025.12 | 34.4 | |
| GRPO + ReProBackbone=Hunyuan-1.8B-Instruct2025.12 | 33.5 | |
| PPOBackbone=Hunyuan-1.8B-Instruct2025.12 | 33.3 | |
| RF++ BBackbone=Hunyuan-1.8B-Instruct2025.12 | 33.3 | |
| OriginalBackbone=Hunyuan-1.8B-Instruct2025.12 | 32.8 | |
| RF++ B + ReProBackbone=Hunyuan-1.8B-Instruct2025.12 | 32.8 | |
| GRPOBackbone=Hunyuan-1.8B-Instruct2025.12 | 32.7 | |
| PPO + ReProBackbone=Hunyuan-1.8B-Instruct2025.12 | 32.1 | |
| DeepSeek-R1-Distill-Llama-8BArchitecture=Dense, # Activated Params=8B, # Total Params=8B2025.12 | 27.8 | |
| PPO + ReProBackbone=MobileLLM-R1-950M2025.12 | 23.1 | |
| PPOBackbone=MobileLLM-R1-950M2025.12 | 22.5 | |
| OriginalBackbone=MobileLLM-R1-950M2025.12 | 18.1 | |
| Phi-3.5-MoEArchitecture=MoE, # Activated Params=6.6B, # Total Params=42B2025.12 | 6.7 |