Mathematical Reasoning on AMC 23 (Acc, Fmt)
49.38AccuracyEP-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EP-GRPOBackbone=Qwen2.5-7B, Sampling Temperature=1.02026.05 | 49.38 | 97.03 | |
| Qwen3-235B-A22b-InstructModel=Qwen3-235B-A22b-Instruct, Sampling Temperature=1.0, Max Output Length=2048, Samples per problem=162026.05 | 47.81 | 55 | |
| GRPOBackbone=Qwen2.5-7B, Sampling Temperature=1.02026.05 | 47.19 | 96.88 | |
| EP-GRPOBackbone=Qwen2.5-3B, Sampling Temperature=1.02026.05 | 39.53 | 95.31 | |
| DeepSeek-R1-671B-0528Model=DeepSeek-R1-671B-0528, Sampling Temperature=1.0, Max Output Length=2048, Samples per problem=162026.05 | 33.91 | 33.91 | |
| GRPO (Higher Temp)Backbone=Qwen2.5-3B, Sampling Temperature=1.2, Rollouts (G)=82026.05 | 32.19 | 96.09 | |
| GRPO (More Rollouts)Backbone=Qwen2.5-3B, Sampling Temperature=1.0, Rollouts (G)=102026.05 | 30.31 | 96.25 | |
| GRPOBackbone=Qwen2.5-3B, Sampling Temperature=1.0, Rollouts (G)=82026.05 | 28.28 | 96.56 | |
| Qwen2.5-7B BaseBackbone=Qwen2.5-7B, Sampling Temperature=1.02026.05 | 23.13 | 82.34 | |
| Qwen2.5-3B BaseBackbone=Qwen2.5-3B, Sampling Temperature=1.02026.05 | 15.94 | 74.38 |