Mathematical Reasoning on AIME 2025 (held-out)
66.7DBSDataChef-32B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DataChef-32BOracle Upper Bound=true, Samples=322026.02 | 66.7 | — | |
| SOURCEbest2026.02 | 39.6 | — | |
| EXPERTModel=Qwen3-1.7B optimized2026.02 | 33.3 | — | |
| Gemini-3-Pro2026.02 | 30 | 80.7 | |
| DataChef-32B2026.02 | 30 | 84.7 | |
| SOURCEavg2026.02 | 23.4 | — | |
| Qwen3-Next ⊕ Kimi-K2Reasoning backbone=Qwen3-Next-80B, Coding backbone=Kimi-K2-Instruct2026.02 | 23.3 | 78.3 | |
| Kimi-K22026.02 | 20 | 35.4 | |
| Qwen3-32B2026.02 | 13.3 | 31.5 |