Mathematical Reasoning on MATH 500 (Avg@3)
76.2Avg@3ADORA
Evaluation Results
| Method | Links | |
|---|---|---|
| ADORABackbone=Qwen2.5-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 76.2 | |
| GRPOBackbone=Qwen2.5-7B, Sampling Temperature=02026.02 | 73.2 | |
| Qwen2.5-7BTraining Method=Base, Sampling Temperature=02026.02 | 57.2 | |
| ADORABackbone=DeepSeek-Math-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 41.8 | |
| GRPOBackbone=DeepSeek-Math-7B, Sampling Temperature=02026.02 | 39.5 | |
| ADORABackbone=Llama-3.1-8B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 39.4 | |
| GRPOBackbone=Llama-3.1-8B, Sampling Temperature=02026.02 | 33.8 | |
| ADORABackbone=Mistral-v0.1-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 30.4 | |
| GRPOBackbone=Mistral-v0.1-7B, Sampling Temperature=02026.02 | 26.8 | |
| DeepSeek-Math-7BTraining Method=Base, Sampling Temperature=02026.02 | 19.6 | |
| Llama-3.1-8BTraining Method=Base, Sampling Temperature=02026.02 | 12.7 | |
| Mistral-v0.1-7BTraining Method=Base, Sampling Temperature=02026.02 | 5.4 |