Mathematical Reasoning on AIME (Accuracy and Delta Change)
92.2AccuracyReasonFlux-PRM-1.5B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ReasonFlux-PRM-1.5BBase Model=GPT-OSS-20B, Size=1.5B, Infer (ms)=175.82026.04 | 92.2 | — | |
| SCATRBase Model=GPT-OSS-20B, Size=6.7M, Infer (ms)=0.26, Speedup=687.5×2026.04 | 89.8 | -2.5 | |
| SCATRBase Model=Qwen-1.7B, Size=6.3M, Infer (ms)=0.17, Speedup=1113.3×2026.04 | 48.9 | 7.8 | |
| SCATRBase Model=Qwen-30B-A3B, Size=2.7M, Infer (ms)=0.3, Speedup=691.3×2026.04 | 42.4 | 4.6 | |
| ReasonFlux-PRM-1.5BBase Model=Qwen-1.7B, Size=1.5B, Infer (ms)=188.72026.04 | 41.1 | — | |
| ReasonFlux-PRM-1.5BBase Model=Qwen-30B-A3B, Size=1.5B, Infer (ms)=175.02026.04 | 37.8 | — |