Mathematical Reasoning on Math 500 (Accuracy, Response Length, Clarity)
83.6AccuracyAccuracy-focused
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Accuracy-focusedTraining RL=GRPO, Weighting Strategy=Accuracy-focused2025.09 | 83.6 | 831 | 94.8 | |
| Gradient-based Weight OptimizationTraining RL=GRPO, Weighting Strategy=Gradient-based2025.09 | 83.6 | 650 | 98 | |
| Efficiency-focusedTraining RL=GRPO, Weighting Strategy=Efficiency-focused2025.09 | 83.5 | 842 | 95 | |
| BalancedTraining RL=GRPO, Weighting Strategy=Balanced2025.09 | 83 | 861 | 96 | |
| Efficiency-focusedTraining RL=RLOO, Weighting Strategy=Efficiency-focused2025.09 | 83 | 824 | 94 | |
| BalancedTraining RL=RLOO, Weighting Strategy=Balanced2025.09 | 82 | 847 | 93.7 | |
| Gradient-based Weight OptimizationTraining RL=RLOO, Weighting Strategy=Gradient-based2025.09 | 82 | 701 | 98 | |
| Accuracy-focusedTraining RL=RLOO, Weighting Strategy=Accuracy-focused2025.09 | 81.5 | 1,100 | 90.5 | |
| Gradient-based Weight OptimizationTraining RL=REINFORCE, Weighting Strategy=Gradient-based2025.09 | 80.2 | 1,202 | 86.8 | |
| Accuracy-focusedTraining RL=REINFORCE, Weighting Strategy=Accuracy-focused2025.09 | 76.4 | 1,375 | 83 | |
| BalancedTraining RL=REINFORCE, Weighting Strategy=Balanced2025.09 | 76 | 1,336 | 85 | |
| Efficiency-focusedTraining RL=REINFORCE, Weighting Strategy=Efficiency-focused2025.09 | 75.5 | 1,361 | 82.5 | |
| PAMATraining RL=GRPO, Weighting Strategy=PAMA2025.09 | 36 | 1,934 | 38.7 | |
| PAMATraining RL=RLOO, Weighting Strategy=PAMA2025.09 | 35.5 | 1,938 | 38.5 | |
| PAMATraining RL=REINFORCE, Weighting Strategy=PAMA2025.09 | 34.1 | 1,929 | 36.9 |