Comprehensive LLM Evaluation on PostTrainBench (test)
53.33AIME 2025Official Instruct Model
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Official Instruct ModelBase Model=Qwen3-4B, Protocol=Official Instruct2026.05 | 53.33 | 86.84 | 95 | 44.64 | 93.78 | 52.72 | 77.44 | 63.75 | |
| GLM-4.7 & ANDES (Ours)Base Model=Qwen3-4B, Method Variant=ANDES2026.05 | 9 | 50.43 | 90 | 30.21 | 82.17 | 29.69 | 65.35 | 40.18 | |
| Opus-4.7 (xHigh)Base Model=Qwen3-4B, Post-Training=Agent-Post-Trained2026.05 | 7.78 | 21.9 | 62 | 24.03 | 63.76 | 16.53 | 62.6 | 30.38 | |
| Opus-4.6 (1M)Base Model=Qwen3-4B, Post-Training=Agent-Post-Trained2026.05 | 6.67 | 5.55 | 97.44 | 29.91 | 78.75 | 10.71 | 57.93 | 31.48 | |
| GPT-5.4 (High)Base Model=Qwen3-4B, Post-Training=Agent-Post-Trained2026.05 | 6.67 | 49.53 | 100 | 34.15 | 83.47 | 29.41 | 66.46 | 41.4 | |
| Opus-4.6Base Model=Qwen3-4B, Post-Training=Agent-Post-Trained2026.05 | 5.56 | 6.34 | 96.67 | 25.3 | 52.19 | 22.87 | 36.59 | 27.71 | |
| Base Model (Qwen3-4B)Protocol=Zero-Shot2026.05 | 3.33 | 3.42 | 0 | 13.39 | 41.85 | 13.38 | 36.59 | 14.34 | |
| Kimi-K2-ThinkingBase Model=Qwen3-4B, Post-Training=Agent-Post-Trained2026.05 | 3.33 | 3.42 | 0 | 13.39 | 19.48 | 13.38 | 36.59 | 12.24 | |
| MiniMax-M2.1Base Model=Qwen3-4B, Post-Training=Agent-Post-Trained2026.05 | 3.33 | 3.42 | 0 | 10.49 | 41.85 | 13.38 | 38.41 | 13.88 | |
| Sonnet-4.5Base Model=Qwen3-4B, Post-Training=Agent-Post-Trained2026.05 | 3.33 | 3.42 | 2 | 13.39 | 41.85 | 9.13 | 44.51 | 14.54 | |
| GLM-4.7 (OpenCode)Base Model=Qwen3-4B, Method Variant=OpenCode2026.05 | 3.33 | 3.42 | 0 | 13.39 | 45.72 | 13.38 | 36.59 | 14.7 | |
| Gemini-3.1-ProBase Model=Qwen3-4B, Post-Training=Agent-Post-Trained2026.05 | 2.22 | 4.98 | 57.33 | 20.16 | 47.54 | 8.82 | 52.03 | 21.35 | |
| GPT-5.2Base Model=Qwen3-4B, Post-Training=Agent-Post-Trained2026.05 | 1.11 | 5.47 | 58.33 | 23.07 | 64.59 | 11.79 | 37.4 | 22.47 | |
| Qwen3-MaxBase Model=Qwen3-4B, Post-Training=Agent-Post-Trained2026.05 | 0 | 2.41 | 0 | 8.04 | 42.61 | 13.38 | 46.34 | 13.39 | |
| MiniMax-M2.5Base Model=Qwen3-4B, Post-Training=Agent-Post-Trained2026.05 | 0 | 3.42 | 0 | 13.39 | 41.85 | 16.03 | 33.54 | 13.75 | |
| GPT-5.1-Codex MaxBase Model=Qwen3-4B, Post-Training=Agent-Post-Trained2026.05 | 0 | 3.77 | 30 | 23.29 | 70.13 | 12.21 | 41.26 | 21.02 | |
| GLM-4.7 (Scaffold-only)Base Model=Qwen3-4B, Method Variant=Scaffold-only2026.05 | 0 | 34.41 | 63 | 22.1 | 67.55 | 9.71 | 56.7 | 26.9 |