Reasoning on MATH-500, AIME 24, AIME 25, GPQA Diamond, CommonsenseQA, LiveCodeBench, and LongBenchv2 Qwen3
74.8AccuracyBase Model
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Base ModelBackbone=Qwen3-32B2026.01 | 74.8 | — | 69.2 | |
| Format-Adaptive-AnswerBackbone=Qwen3-32B2026.01 | 72.2 | — | 72.3 | |
| Adaptive-AnswerBackbone=Qwen3-32B2026.01 | 72.1 | — | 72.5 | |
| Base ModelBackbone=Qwen3-8B2026.01 | 69.9 | — | 71.6 | |
| Adaptive-AnswerBackbone=Qwen3-8B2026.01 | 69 | — | 75.5 | |
| Format-Adaptive-AnswerBackbone=Qwen3-8B2026.01 | 68.7 | — | 76.6 | |
| Base ModelBackbone=Qwen3-1.7B2026.01 | 50.9 | — | 65.4 | |
| Format-Adaptive-AnswerBackbone=DeepSeek-R1-Qwen-7B-Distill2026.01 | 50.7 | — | 59.7 | |
| Adaptive-AnswerBackbone=DeepSeek-R1-Qwen-7B-Distill2026.01 | 50.4 | 513,318 | 59.6 | |
| Base ModelBackbone=DeepSeek-R1-Qwen-7B-Distill2026.01 | 50.3 | — | 62.1 | |
| Adaptive-AnswerBackbone=Qwen3-1.7B2026.01 | 49.1 | — | 62.1 | |
| Format-Adaptive-AnswerBackbone=Qwen3-1.7B2026.01 | 48.3 | — | 62.1 |