Reasoning on MMLU-Pro (Accuracy and Resource Usage)
60.11AccuracyCoT Cold-Start + Solver Feedback
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CoT Cold-Start + Solver FeedbackModel=Qwen3-4B-Base2025.11 | 60.11 | — | — | — | |
| Self-Instruct + Solver FeedbackModel=Qwen3-4B-Base2025.11 | 59.78 | — | — | — | |
| Self-Instruct + R-ZeroModel=Qwen3-4B-Base2025.11 | 58.79 | — | — | — | |
| Self-Instruct + CoT-Self-InstructModel=Qwen3-4B-Base2025.11 | 57.86 | — | — | — | |
| CoT Cold-StartModel=Qwen3-4B-Base2025.11 | 57.12 | — | — | — | |
| Self-InstructModel=Qwen3-4B-Base2025.11 | 56.79 | — | — | — | |
| SCBackbone=Qwen2.5-7B2026.02 | 56.62 | 40 | — | 5.7 | |
| DSCBackbone=Qwen2.5-7B2026.02 | 56.6 | 11.1 | 1.2 | 3 | |
| ACBackbone=Qwen2.5-7B2026.02 | 56.59 | 9.8 | — | 5.3 | |
| ESCBackbone=Qwen2.5-7B2026.02 | 56.59 | 13.7 | — | 4.2 | |
| ACTSCBackbone=Qwen2.5-7B2026.02 | 56.36 | 6.6 | — | 2.9 | |
| CoT Cold-Start + R-ZeroModel=Qwen3-4B-Base2025.11 | 53.67 | — | — | — | |
| CoT Cold-Start + RLMTModel=Qwen3-4B-Base2025.11 | 53.28 | — | — | — | |
| Seed SetModel=Qwen3-4B-Base2025.11 | 52.88 | — | — | — | |
| Base ModelModel=Qwen3-4B-Base2025.11 | 37.38 | — | — | — |