Multi-Task Reasoning on MMLU-Pro
69.3Pass@1Composition-RL
Evaluation Results
| Method | Links | |
|---|---|---|
| Composition-RLBackbone=Qwen3-14B-Base2026.02 | 69.3 | |
| Standard RLVRBackbone=Qwen3-14B-Base2026.02 | 67.2 | |
| Composition-RLBackbone=Qwen3-30B-A3B-Base2026.02 | 64.6 | |
| Composition-RLBackbone=Qwen3-4B-Base, Curriculum=Depth 1 + 2 + 32026.02 | 64.5 | |
| Composition-RLBackbone=Qwen3-8B-Base2026.02 | 64.5 | |
| Composition-RLBackbone=Qwen3-4B-Base, Curriculum=Depth 1 + 22026.02 | 63.8 | |
| Standard RLVRBackbone=Qwen3-8B-Base2026.02 | 62.6 | |
| Standard RLVRBackbone=Qwen3-30B-A3B-Base2026.02 | 62.6 | |
| Composition-RLBackbone=Qwen3-4B-Base2026.02 | 61.4 | |
| Standard RLVRBackbone=Qwen3-4B-Base2026.02 | 58.6 | |
| Before RL (Base)Backbone=Qwen2.5-7B, Training Set=MATH2026.05 | 47.21 | |
| GT-RewardBackbone=Qwen2.5-7B, Training Set=MATH2026.05 | 43.17 | |
| VIGORBackbone=Qwen2.5-7B, Training Set=MATH2026.05 | 43.09 | |
| INTUITORBackbone=Qwen2.5-7B, Training Set=MATH2026.05 | 43.04 | |
| GT-RewardBackbone=Qwen2.5-3B, Training Set=MATH2026.05 | 38.17 | |
| Before RL (Base)Backbone=Qwen2.5-3B, Training Set=MATH2026.05 | 36.92 | |
| VIGORBackbone=Qwen2.5-3B, Training Set=MATH2026.05 | 32.65 | |
| INTUITORBackbone=Qwen2.5-3B, Training Set=MATH2026.05 | 24.48 |