Mathematical Reasoning on Macro Average Selected Benchmarks
52.8Pass@1 (Avg@32)Mix-RL
Evaluation Results
| Method | Links | |
|---|---|---|
| Mix-RLModel Backbone=Qwen2.5-Math-7B, Gen Mode=Fold2026.02 | 52.8 | |
| Fold-RLModel Backbone=Qwen2.5-Math-7B, Gen Mode=Fold2026.02 | 52.7 | |
| Unfold-RLModel Backbone=Qwen2.5-Math-7B, Gen Mode=Unfold2026.02 | 52.2 | |
| Fold-RLModel Backbone=Qwen3-4B-Base, Gen Mode=Fold2026.02 | 52.1 | |
| Mix-RLModel Backbone=Qwen3-4B-Base, Gen Mode=Fold2026.02 | 52.1 | |
| Unfold-RLModel Backbone=Qwen3-4B-Base, Gen Mode=Unfold2026.02 | 52 | |
| Unfold-RLModel Backbone=Qwen2.5-Math-7B, Gen Mode=Fold2026.02 | 50.3 | |
| Unfold-RLModel Backbone=Qwen3-4B-Base, Gen Mode=Fold2026.02 | 49.2 | |
| Cold-StartModel Backbone=Qwen2.5-Math-7B, Gen Mode=Unfold2026.02 | 48.5 | |
| Zero-RLModel Backbone=Qwen3-4B-Base, Gen Mode=Unfold2026.02 | 47.6 | |
| Cold-StartModel Backbone=Qwen3-4B-Base, Gen Mode=Unfold2026.02 | 47.5 | |
| Cold-StartModel Backbone=Qwen2.5-Math-7B, Gen Mode=Fold2026.02 | 45.7 | |
| Zero-RLModel Backbone=Qwen2.5-Math-7B, Gen Mode=Unfold2026.02 | 44.6 | |
| Cold-StartModel Backbone=Qwen3-4B-Base, Gen Mode=Fold2026.02 | 42.6 |