Language Modeling on 10 LLM benchmark suite macro-average
71.8PASS-AT-1 AccuracyQwen3.5-27B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3.5-27BRole=Teacher2026.06 | 71.8 | — | |
| Qwen3.5-9BTraining Stage=ZPPO2026.06 | 68.8 | 3.9 | |
| Qwen3.5-4BTraining Stage=ZPPO2026.06 | 65.5 | 3.9 | |
| Qwen3.5-9BTraining Stage=Base2026.06 | 64.9 | — | |
| Qwen3.5-4BTraining Stage=Base2026.06 | 61.6 | — | |
| Qwen3.5-2BTraining Stage=ZPPO2026.06 | 50.4 | 5.1 | |
| Qwen3.5-2BTraining Stage=Base2026.06 | 45.3 | — | |
| Qwen3.5-0.8BTraining Stage=ZPPO2026.06 | 33.1 | 7.9 | |
| Qwen3.5-0.8BTraining Stage=Base2026.06 | 25.2 | — |