Mathematical Reasoning on OlympiadBench (Accuracy, Pass@1)
64Pass@1Qwen3-4B-Instruct-2507
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-4B-Instruct-2507Data=N/A, Train=N/A, Base=N/A2025.12 | 64 | — | |
| NPRData=orz-8k, Train=Parallel RL, Base=NPR-BETA2025.12 | 63.7 | — | |
| SRData=orz-8k, Train=Sequential RL, Base=NPR-BETA2025.12 | 62.2 | — | |
| NPR (Variant)Data=orz-8k, Train=Parallel RL, Base=NPR-BETA2025.12 | 61.9 | — | |
| NPR-BETAData=orz-8k, Train=Parallel SFT, Base=Q3-4B-Inst.2025.12 | 60.1 | — | |
| NPR-BETA (Variant)Data=orz-8k, Train=Parallel SFT, Base=Q3-4B2025.12 | 57.8 | — | |
| SR-BETAData=orz-8k, Train=Sequential SFT, Base=Q3-4B-Inst.2025.12 | 56.3 | — | |
| Qwen3-4B (Non-Thinking)Data=N/A, Train=N/A, Base=N/A2025.12 | 48.6 | — | |
| Multiverse-32BData=s1.1-8k, Train=S→P SFT, Base=Q2.5-32B-Inst.2025.12 | 48 | — | |
| Qwen2.5-32B-InstructData=N/A, Train=N/A, Base=N/A2025.12 | 46.4 | — | |
| Segment Selective SFTModel Backbone=Qwen2.5-7B-Instruct, Decoding Strategy=Temperature Sampling2026.01 | 41.9 | — | |
| Multiverse-4BData=s1.1-8k, Train=S→P SFT, Base=Q3-4B-Inst.2025.12 | 38.8 | — |