Mathematical Reasoning on AMC23 (val)
80Accuracyλ-GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| λ-GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=0.042025.09 | 80 | |
| BaseModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=N/A2025.09 | 75 | |
| λ-GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=02025.09 | 75 | |
| GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=0.042025.09 | 75 | |
| GenACAlgorithm=GenAC, Base Model=Qwen3-8B-Base, Sampled generations=16, RL Setup=Zero RL2026.04 | 74.53 | |
| VC-PPOAlgorithm=VC-PPO, Base Model=Qwen3-8B-Base, Sampled generations=16, RL Setup=Zero RL2026.04 | 70.78 | |
| GRPOAlgorithm=GRPO, Base Model=Qwen3-8B-Base, Sampled generations=16, RL Setup=Zero RL2026.04 | 69.69 | |
| RLOOAlgorithm=RLOO, Base Model=Qwen3-8B-Base, Sampled generations=16, RL Setup=Zero RL2026.04 | 68.75 | |
| GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B, beta=02025.09 | 62.5 | |
| OBLR-POModel=Qwen3-4B-Base2025.11 | 55 | |
| RLOOModel=Qwen3-8B-Base2025.11 | 55 | |
| PPOModel=Qwen3-8B-Base2025.11 | 52.5 | |
| ReMaxModel=Qwen3-4B-Base2025.11 | 50 | |
| GRPOModel=Qwen3-4B-Base2025.11 | 47.5 | |
| PPOModel=Qwen3-4B-Base2025.11 | 47.5 | |
| ReMaxModel=Qwen3-8B-Base2025.11 | 47.5 | |
| OBLR-POModel=Qwen3-8B-Base2025.11 | 47.5 | |
| RLOOModel=Qwen3-4B-Base2025.11 | 42.5 | |
| GRPOModel=Qwen3-8B-Base2025.11 | 42.5 | |
| GRPOModel=Llama-3.2-1B-Instruct, beta=0.042025.09 | 17.5 | |
| λ-GRPOModel=Llama-3.2-1B-Instruct, beta=02025.09 | 12.5 | |
| BaseModel=Llama-3.2-1B-Instruct, beta=N/A2025.09 | 7.5 | |
| GRPOModel=Llama-3.2-1B-Instruct, beta=02025.09 | 7.5 | |
| λ-GRPOModel=Llama-3.2-1B-Instruct, beta=0.042025.09 | 7.5 |