Mathematical Reasoning on GSM8K (Avg@3)
89.6Avg@3 ScoreADORA
Evaluation Results
| Method | Links | |
|---|---|---|
| ADORABackbone=Qwen2.5-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 89.6 | |
| GRPOBackbone=Qwen2.5-7B, Sampling Temperature=02026.02 | 89.1 | |
| ADORABackbone=DeepSeek-Math-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 68.5 | |
| GRPOBackbone=DeepSeek-Math-7B, Sampling Temperature=02026.02 | 68.2 | |
| ADORABackbone=Llama-3.1-8B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 66.7 | |
| GRPOBackbone=Llama-3.1-8B, Sampling Temperature=02026.02 | 66.1 | |
| Qwen2.5-7BTraining Method=Base, Sampling Temperature=02026.02 | 56.3 | |
| GRPOBackbone=Mistral-v0.1-7B, Sampling Temperature=02026.02 | 54 | |
| ADORABackbone=Mistral-v0.1-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 53.8 | |
| Llama-3.1-8BTraining Method=Base, Sampling Temperature=02026.02 | 40.2 | |
| DeepSeek-Math-7BTraining Method=Base, Sampling Temperature=02026.02 | 28.4 | |
| Mistral-v0.1-7BTraining Method=Base, Sampling Temperature=02026.02 | 21.2 |