Reasoning on Combined Reasoning Benchmarks
59.29Overall AccuracyOpenSIR
Evaluation Results
| Method | Links | |
|---|---|---|
| OpenSIRBackbone=Qwen3-8B, Training Method=OpenSIR2025.11 | 59.29 | |
| GRPOmathBackbone=Qwen3-8B, Training Method=GRPOmath2025.11 | 56.18 | |
| BaseBackbone=Qwen3-8B, Training Method=Base2025.11 | 55.89 | |
| GRPOgsm8kBackbone=Qwen3-8B, Training Method=GRPOgsm8k2025.11 | 55.15 | |
| Absolute ZeroBackbone=Qwen3-8B, Training Method=Absolute Zero2025.11 | 54.53 | |
| R-ZeroBackbone=Qwen3-8B, Training Method=R-Zero2025.11 | 53.96 | |
| WISTBackbone=Qwen3-14B-Base2026.03 | 49.4 | |
| SPICEBackbone=Qwen3-14B-Base2026.03 | 48.6 | |
| R-ZeroBackbone=Qwen3-14B-Base2026.03 | 47.5 | |
| Base ModelBackbone=Qwen3-14B-Base2026.03 | 46.2 | |
| OpenSIRBackbone=DeepSeek-R1-Distill-Llama-8B, Training Method=OpenSIR2025.11 | 40.56 | |
| GRPOmathBackbone=DeepSeek-R1-Distill-Llama-8B, Training Method=GRPOmath2025.11 | 37.27 | |
| GRPOgsm8kBackbone=DeepSeek-R1-Distill-Llama-8B, Training Method=GRPOgsm8k2025.11 | 36.97 | |
| BaseBackbone=DeepSeek-R1-Distill-Llama-8B, Training Method=Base2025.11 | 36.31 | |
| R-ZeroBackbone=DeepSeek-R1-Distill-Llama-8B, Training Method=R-Zero2025.11 | 36.25 | |
| Absolute ZeroBackbone=DeepSeek-R1-Distill-Llama-8B, Training Method=Absolute Zero2025.11 | 35.66 |