General Reasoning Performance on AIME 2025, GPQA-Diamond, LiveCodeBench v6, and LongBench v2
57.67Avg@4Regular
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RegularBackbone=Qwen3.5-9B, Response Budget=32K-slot2026.05 | 57.67 | 68.03 | |
| PIPO-SFT + OPDBackbone=Qwen3.5-9B, Response Budget=32K-slot2026.05 | 57.34 | 75.18 | |
| Eagle-2Backbone=Qwen3.5-9B, Response Budget=32K-slot2026.05 | 53.09 | 63.43 | |
| RegularBackbone=Qwen3.5-4B, Response Budget=32K-slot2026.05 | 52.16 | 63.48 | |
| PIPO-SFTBackbone=Qwen3.5-9B, Response Budget=32K-slot2026.05 | 51.18 | 71.58 | |
| PIPO-SFT + OPDBackbone=Qwen3.5-4B, Response Budget=32K-slot2026.05 | 46.52 | 67.31 | |
| Eagle-2Backbone=Qwen3.5-4B, Response Budget=32K-slot2026.05 | 46.21 | 60.26 | |
| PIPO-SFTBackbone=Qwen3.5-4B, Response Budget=32K-slot2026.05 | 45.28 | 65.01 | |
| MTPBackbone=Qwen3.5-9B, Response Budget=32K-slot2026.05 | 41.61 | 56.1 | |
| MTPBackbone=Qwen3.5-4B, Response Budget=32K-slot2026.05 | 38.5 | 52.28 |