Mathematical Reasoning on Minerva (Exact-match accuracy)
29.78Exact Match AccuracyBase
Evaluation Results
| Method | Links | |
|---|---|---|
| BaseModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=N/A2025.09 | 29.78 | |
| λ-GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=0.042025.09 | 29.78 | |
| λ-GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=02025.09 | 29.04 | |
| GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=0.042025.09 | 26.1 | |
| GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=02025.09 | 25 | |
| λ-GRPOModel=Llama-3.2-1B-Instruct, beta=0.042025.09 | 7.35 | |
| GRPOModel=Llama-3.2-1B-Instruct, beta=02025.09 | 5.51 | |
| λ-GRPOModel=Llama-3.2-1B-Instruct, beta=02025.09 | 5.15 | |
| GRPOModel=Llama-3.2-1B-Instruct, beta=0.042025.09 | 5.15 | |
| BaseModel=Llama-3.2-1B-Instruct, beta=N/A2025.09 | 4.78 |