Scientific Reasoning on GPQA Diamond (Acc, ARI, ABO, AIRW)
64AccuracyBase Model
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Base ModelBackbone=Qwen3-30B-A3B2026.05 | 64 | 7,203 | 6,768 | 6,768 | |
| SxS Interleaved (RL Final)Backbone=Qwen3-30B-A3B, Training Stage=RL Final2026.05 | 57.1 | 12,933 | 12,834 | 9,468 | |
| Base ModelBackbone=Qwen3-4B2026.05 | 55.9 | 8,521 | 8,108 | 8,108 | |
| Standard CoT (RL Final)Backbone=Qwen3-30B-A3B, Training Stage=RL Final2026.05 | 51.4 | 13,969 | 13,773 | 13,773 | |
| SxS Interleaved (RL Final)Backbone=Qwen3-4B, Training Stage=RL Final2026.05 | 49.3 | 15,572 | 15,709 | 7,738 | |
| SxS Interleaved (RL Recovery)Backbone=Qwen3-30B-A3B, Training Stage=RL Recovery2026.05 | 46.1 | 11,090 | 11,513 | 6,370 | |
| SxS Interleaved (RL Recovery)Backbone=Qwen3-4B, Training Stage=RL Recovery2026.05 | 32.5 | 13,148 | 13,372 | 7,103 | |
| Standard CoT (SFT)Backbone=Qwen3-30B-A3B, Training Stage=SFT2026.05 | 26.1 | 14,817 | 14,502 | 14,502 | |
| SxS Interleaved (SFT)Backbone=Qwen3-30B-A3B, Training Stage=SFT2026.05 | 23.1 | 7,524 | 8,578 | 3,864 | |
| Standard CoT (RL Final)Backbone=Qwen3-4B, Training Stage=RL Final2026.05 | 19 | 16,597 | 16,338 | 16,338 | |
| Standard CoT (SFT)Backbone=Qwen3-4B, Training Stage=SFT2026.05 | 17.2 | 19,379 | 19,094 | 19,094 | |
| SxS Interleaved (SFT)Backbone=Qwen3-4B, Training Stage=SFT2026.05 | 13.8 | 8,854 | 10,106 | 4,995 |