Mathematical Reasoning on AIME 24 (Avg@3)
16.7Avg@3ADORA
Evaluation Results
| Method | Links | |
|---|---|---|
| ADORABackbone=Qwen2.5-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 16.7 | |
| GRPOBackbone=Qwen2.5-7B, Sampling Temperature=02026.02 | 13.3 | |
| Qwen2.5-7BTraining Method=Base, Sampling Temperature=02026.02 | 10 | |
| GRPOBackbone=DeepSeek-Math-7B, Sampling Temperature=02026.02 | 3.3 | |
| ADORABackbone=DeepSeek-Math-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 3.3 | |
| DeepSeek-Math-7BTraining Method=Base, Sampling Temperature=02026.02 | 0 | |
| Mistral-v0.1-7BTraining Method=Base, Sampling Temperature=02026.02 | 0 | |
| GRPOBackbone=Mistral-v0.1-7B, Sampling Temperature=02026.02 | 0 | |
| ADORABackbone=Mistral-v0.1-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 0 | |
| Llama-3.1-8BTraining Method=Base, Sampling Temperature=02026.02 | 0 | |
| GRPOBackbone=Llama-3.1-8B, Sampling Temperature=02026.02 | 0 | |
| ADORABackbone=Llama-3.1-8B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 0 |