General Tasks on MMLU-Redux2
91.67PAQUCPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UCPOBackbone Model=Qwen3-8B2026.01 | 91.67 | 85.42 | |
| GRPO-UCBackbone Model=Qwen3-8B, Reward Coefficient (ru)=0.52026.01 | 88.82 | 86.61 | |
| GRPO-UCBackbone Model=Qwen3-8B, Reward Coefficient (ru)=0.82026.01 | 88.51 | 87.51 | |
| GRPO-UCBackbone Model=Qwen3-8B, Reward Coefficient (ru)=0.22026.01 | 88.13 | 87.61 | |
| GRPOBackbone Model=Qwen3-8B2026.01 | 87.62 | 87.21 | |
| BaselineBackbone Model=Qwen3-8B2026.01 | 87.2 | 87.2 | |
| Prompt-UCBackbone Model=Qwen3-8B2026.01 | 87.08 | 86.33 | |
| UCPOBackbone Model=Llama-3.1-8B-Instruct2026.01 | 81.13 | 69.03 | |
| GRPO-UCBackbone Model=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.52026.01 | 78.89 | 71.51 | |
| GRPO-UCBackbone Model=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.82026.01 | 76.99 | 69.78 | |
| GRPO-UCBackbone Model=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.22026.01 | 72.47 | 72.47 | |
| GRPOBackbone Model=Llama-3.1-8B-Instruct2026.01 | 71.23 | 71.23 | |
| Prompt-UCBackbone Model=Llama-3.1-8B-Instruct2026.01 | 68.02 | 67.41 | |
| BaselineBackbone Model=Llama-3.1-8B-Instruct2026.01 | 65.17 | 65.17 |