Math and Text Reasoning on MATH 500
97.28PAQUCPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UCPOBackbone=Qwen3-8B2026.01 | 97.28 | 96.4 | |
| BaselineBackbone=Qwen3-8B2026.01 | 96.8 | 96.8 | |
| GRPOBackbone=Qwen3-8B2026.01 | 96.46 | 96.36 | |
| GRPO-UCBackbone=Qwen3-8B, Reward Coefficient (ru)=0.22026.01 | 96.31 | 95.99 | |
| GRPO-UCBackbone=Qwen3-8B, Reward Coefficient (ru)=0.52026.01 | 96.24 | 95.95 | |
| GRPO-UCBackbone=Qwen3-8B, Reward Coefficient (ru)=0.82026.01 | 96.2 | 96.2 | |
| Prompt-UCBackbone=Qwen3-8B2026.01 | 95.8 | 95.8 | |
| UCPOBackbone=Llama-3.1-8B-Instruct2026.01 | 60.95 | 51.95 | |
| GRPO-UCBackbone=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.52026.01 | 57.61 | 25.53 | |
| GRPO-UCBackbone=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.82026.01 | 56.61 | 12.67 | |
| Prompt-UCBackbone=Llama-3.1-8B-Instruct2026.01 | 47.32 | 46.34 | |
| BaselineBackbone=Llama-3.1-8B-Instruct2026.01 | 45.8 | 45.8 | |
| GRPOBackbone=Llama-3.1-8B-Instruct2026.01 | 43.96 | 43.95 | |
| GRPO-UCBackbone=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.22026.01 | 40.98 | 33.6 |