Mathematical Reasoning on AIME 2025 (Avg@10 and Pass@10)
50Avg@10Qwen3-4B RL finetuned on HanabiRewards
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-4B RL finetuned on HanabiRewardsBackbone=Qwen3-4B, Variant=Ours-RL, Training=RL finetuned on HanabiRewards2026.01 | 50 | 73.3 | |
| Qwen3-4B-Instruct-2507Backbone=Qwen3-4B, Variant=Base2026.01 | 48.7 | 73.3 |