Mathematical Reasoning on HMMT 26 (Accuracy)
29.4Accuracyp1
Evaluation Results
| Method | Links | |
|---|---|---|
| p1Backbone=Qwen3-4B-Instruct-2507, S=[1, 23], M=16, Training Reward Imp.=0.212026.04 | 29.4 | |
| p1Backbone=Qwen3-4B-Instruct-2507, S=[17, 27], M=16, Training Reward Imp.=0.092026.04 | 28.27 | |
| p1Backbone=Qwen3-4B-Instruct-2507, S=[4, 5, 17, 20], M=8, Training Reward Imp.=0.042026.04 | 28.13 | |
| p1Backbone=Qwen3-4B-Instruct-2507, S=[23], M=32, Training Reward Imp.=0.072026.04 | 27.98 | |
| baseBackbone=Qwen3-4B-Instruct-2507, S=/, M=/, Training Reward Imp.=/2026.04 | 27.89 | |
| GEPABackbone=Qwen3-4B-Instruct-2507, S=[1,23]/28, M=/, Training Reward Imp.=/2026.04 | 27.46 | |
| GEPABackbone=Qwen3-4B-Instruct-2507, S=28/[1,23], M=/, Training Reward Imp.=/2026.04 | 27.32 | |
| GEPABackbone=Qwen3-4B-Instruct-2507, S=15/15, M=/, Training Reward Imp.=/2026.04 | 27.08 | |
| RLBackbone=Qwen3-4B-Instruct-2507, S=all 30, M=1, Training Reward Imp.=02026.04 | 27.04 | |
| p1Backbone=Qwen3-4B-Instruct-2507, S=[25], M=32, Training Reward Imp.=0.072026.04 | 26.09 | |
| baseBackbone=Qwen3-1.7B, S=/, M=/, Training Reward Imp.=/2026.04 | 23.96 | |
| GEPABackbone=Qwen3-1.7B, S=15/15, M=/, Training Reward Imp.=/2026.04 | 23.77 | |
| GEPABackbone=Qwen3-1.7B, S=[5,26]/28, M=/, Training Reward Imp.=/2026.04 | 23.72 | |
| GEPABackbone=Qwen3-1.7B, S=28/[5,26], M=/, Training Reward Imp.=/2026.04 | 23.58 | |
| p1Backbone=Qwen3-1.7B, S=[10, 11], M=16, Training Reward Imp.=0.142026.04 | 23.58 | |
| p1Backbone=Qwen3-1.7B, S=[5, 26], M=16, Training Reward Imp.=0.132026.04 | 23.48 | |
| RLBackbone=Qwen3-1.7B, S=all 30, M=1, Training Reward Imp.=02026.04 | 23.44 | |
| p1Backbone=Qwen3-1.7B, S=[5, 14, 20, 26], M=8, Training Reward Imp.=0.052026.04 | 23.34 | |
| p1Backbone=Qwen3-1.7B, S=[5], M=32, Training Reward Imp.=0.252026.04 | 23.2 | |
| p1Backbone=Qwen3-1.7B, S=[26], M=32, Training Reward Imp.=0.292026.04 | 22.96 |