Multi-step Reasoning on Big-Bench Hard
71.02AccuracyOuro-1.4B-R4
Evaluation Results
| Method | Links | |
|---|---|---|
| Ouro-1.4B-R4Total Parameters=1.4B, Active Parameters=1.4B, Training Tokens=7.7T2026.06 | 71.02 | |
| Qwen-3-1.7BTotal Parameters=1.7B, Active Parameters=1.7B, Training Tokens=36T2026.06 | 53.51 | |
| PowerMoE-3BTotal Parameters=3B, Active Parameters=0.8B, Training Tokens=3T2026.06 | 33.07 | |
| LoopMoETotal Parameters=3B, Active Parameters=0.8B‡, Training Tokens=200B2026.06 | 27.94 | |
| OLMoE-1B-7BTotal Parameters=7B, Active Parameters=1B, Training Tokens=200B2026.06 | 26.85 | |
| Vanilla MoETotal Parameters=3B, Active Parameters=0.8B, Training Tokens=200B2026.06 | 26.12 | |
| Pythia-1.4BTotal Parameters=1.4B, Active Parameters=1.4B, Training Tokens=200B2026.06 | 23.71 | |
| OLMo2-1BTotal Parameters=1.0B, Active Parameters=1.0B, Training Tokens=200B2026.06 | 9.45 |