Math and Text Reasoning on Olympiad Bench
73.67PAQUCPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UCPOBackbone=Qwen3-8B2026.01 | 73.67 | 69.42 | |
| Prompt-UCBackbone=Qwen3-8B2026.01 | 71.49 | 70.47 | |
| GRPO-UCBackbone=Qwen3-8B, Reward Coefficient (ru)=0.52026.01 | 70.84 | 68.64 | |
| GRPO-UCBackbone=Qwen3-8B, Reward Coefficient (ru)=0.22026.01 | 70.68 | 68.35 | |
| GRPO-UCBackbone=Qwen3-8B, Reward Coefficient (ru)=0.82026.01 | 70.68 | 69.24 | |
| BaselineBackbone=Qwen3-8B2026.01 | 69.63 | 69.63 | |
| GRPOBackbone=Qwen3-8B2026.01 | 69.22 | 68.25 | |
| UCPOBackbone=Llama-3.1-8B-Instruct2026.01 | 25.56 | 17.69 | |
| GRPO-UCBackbone=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.52026.01 | 19.28 | 4.22 | |
| Prompt-UCBackbone=Llama-3.1-8B-Instruct2026.01 | 17.45 | 16.61 | |
| BaselineBackbone=Llama-3.1-8B-Instruct2026.01 | 14.96 | 14.96 | |
| GRPOBackbone=Llama-3.1-8B-Instruct2026.01 | 14.76 | 14.74 | |
| GRPO-UCBackbone=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.22026.01 | 13.58 | 9.38 | |
| GRPO-UCBackbone=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.82026.01 | 12.9 | 1.49 |