Mathematical Reasoning on AMC23 (Avg@3)
62.5Avg@3 ScoreADORA
Evaluation Results
| Method | Links | |
|---|---|---|
| ADORABackbone=Qwen2.5-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 62.5 | |
| GRPOBackbone=Qwen2.5-7B, Sampling Temperature=02026.02 | 50 | |
| Qwen2.5-7BTraining Method=Base, Sampling Temperature=02026.02 | 37.5 | |
| ADORABackbone=DeepSeek-Math-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 25 | |
| GRPOBackbone=DeepSeek-Math-7B, Sampling Temperature=02026.02 | 20 | |
| GRPOBackbone=Llama-3.1-8B, Sampling Temperature=02026.02 | 15 | |
| ADORABackbone=Llama-3.1-8B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 15 | |
| DeepSeek-Math-7BTraining Method=Base, Sampling Temperature=02026.02 | 10 | |
| GRPOBackbone=Mistral-v0.1-7B, Sampling Temperature=02026.02 | 10 | |
| ADORABackbone=Mistral-v0.1-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 10 | |
| Llama-3.1-8BTraining Method=Base, Sampling Temperature=02026.02 | 2.5 | |
| Mistral-v0.1-7BTraining Method=Base, Sampling Temperature=02026.02 | 0 |