Hierarchical Task Decomposition on MagicEval-Plan General 3
35.1Step CountQwen3-30B-A3B-Instruct
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-30B-A3B-InstructScale=Large-Scale Models2026.02 | 35.1 | 90.3 | 78.7 | |
| GPT-5.2Scale=Ultra-Scale Models2026.02 | 36.8 | 89.7 | 92 | |
| Llama3.3-70B-InstructScale=Large-Scale Models2026.02 | 36.8 | 92.1 | 82.6 | |
| Olmo-3.1-32B-InstructScale=Large-Scale Models2026.02 | 48.5 | 91.5 | 82.4 | |
| GLM-4.7-FlashScale=Large-Scale Models2026.02 | 48.5 | 86.8 | 72.6 | |
| Qwen3-32B-nothinkScale=Large-Scale Models2026.02 | 64.5 | 91.6 | 87.1 | |
| Qwen3-235B-A22B-InstructScale=Ultra-Scale Models2026.02 | 70.6 | 91.4 | 85.1 | |
| ERNIE-4.5-21B-A3B-PTScale=Large-Scale Models2026.02 | 72.7 | 92.4 | 85.1 | |
| DeepSeek-V3.1-nothinkScale=Ultra-Scale Models2026.02 | 81 | 96.8 | 84 | |
| Qwen3-MAXScale=Ultra-Scale Models2026.02 | 81 | 92.7 | 89.3 | |
| Kimi-K2-InstructScale=Ultra-Scale Models2026.02 | 85.7 | 91.9 | 86.7 | |
| GLM-4.7Scale=Ultra-Scale Models2026.02 | 87.9 | 97 | 88.1 | |
| MagicAgent-30B-A3BScale=MagicAgent Series2026.02 | 97.6 | 95.9 | 91 | |
| MagicAgent-32BScale=MagicAgent Series2026.02 | 98 | 95.6 | 91.2 |