Mathematical Reasoning on OlympiadBench (Avg@3)
36Avg@3ADORA
Evaluation Results
| Method | Links | |
|---|---|---|
| ADORABackbone=Qwen2.5-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 36 | |
| GRPOBackbone=Qwen2.5-7B, Sampling Temperature=02026.02 | 35.1 | |
| Qwen2.5-7BTraining Method=Base, Sampling Temperature=02026.02 | 26.3 | |
| ADORABackbone=DeepSeek-Math-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 12.9 | |
| GRPOBackbone=DeepSeek-Math-7B, Sampling Temperature=02026.02 | 12 | |
| ADORABackbone=Llama-3.1-8B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 10.5 | |
| GRPOBackbone=Llama-3.1-8B, Sampling Temperature=02026.02 | 5.3 | |
| ADORABackbone=Mistral-v0.1-7B, Training Method=GRPO + ADORA, Sampling Temperature=02026.02 | 4.7 | |
| GRPOBackbone=Mistral-v0.1-7B, Sampling Temperature=02026.02 | 4.1 | |
| Llama-3.1-8BTraining Method=Base, Sampling Temperature=02026.02 | 3.1 | |
| DeepSeek-Math-7BTraining Method=Base, Sampling Temperature=02026.02 | 3 | |
| Mistral-v0.1-7BTraining Method=Base, Sampling Temperature=02026.02 | 2.4 |