Math and Text Reasoning on AIME 24
86.11PAQUCPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UCPOBackbone=Qwen3-8B2026.01 | 86.11 | 76.54 | |
| GRPO-UCBackbone=Qwen3-8B, Reward Coefficient (ru)=0.22026.01 | 83.75 | 78.82 | |
| GRPO-UCBackbone=Qwen3-8B, Reward Coefficient (ru)=0.52026.01 | 80 | 75.29 | |
| GRPOBackbone=Qwen3-8B2026.01 | 77.01 | 75.71 | |
| BaselineBackbone=Qwen3-8B2026.01 | 73.33 | 73.33 | |
| Prompt-UCBackbone=Qwen3-8B2026.01 | 73.33 | 73.33 | |
| GRPO-UCBackbone=Qwen3-8B, Reward Coefficient (ru)=0.82026.01 | 72.41 | 71.19 | |
| Prompt-UCBackbone=Llama-3.1-8B-Instruct2026.01 | 6.98 | 6.82 | |
| UCPOBackbone=Llama-3.1-8B-Instruct2026.01 | 5.13 | 3.1 | |
| GRPO-UCBackbone=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.22026.01 | 3.85 | 2.82 | |
| BaselineBackbone=Llama-3.1-8B-Instruct2026.01 | 3.33 | 3.33 | |
| GRPOBackbone=Llama-3.1-8B-Instruct2026.01 | 3.33 | 3.33 | |
| GRPO-UCBackbone=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.52026.01 | 0 | 0 | |
| GRPO-UCBackbone=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.82026.01 | 0 | 0 |