Math and Text Reasoning on AMC (PAQ, F1)
95.06PAQGRPO-UC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPO-UCBackbone=Qwen3-8B, Reward Coefficient (ru)=0.82026.01 | 95.06 | 93.9 | |
| UCPOBackbone=Qwen3-8B2026.01 | 91.95 | 89.48 | |
| BaselineBackbone=Qwen3-8B2026.01 | 91.57 | 91.57 | |
| GRPO-UCBackbone=Qwen3-8B, Reward Coefficient (ru)=0.52026.01 | 90 | 88.34 | |
| Prompt-UCBackbone=Qwen3-8B2026.01 | 89.02 | 88.48 | |
| GRPO-UCBackbone=Qwen3-8B, Reward Coefficient (ru)=0.22026.01 | 88.98 | 88.26 | |
| GRPOBackbone=Qwen3-8B2026.01 | 88.35 | 88.35 | |
| UCPOBackbone=Llama-3.1-8B-Instruct2026.01 | 28.12 | 22 | |
| GRPO-UCBackbone=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.52026.01 | 21.43 | 6.19 | |
| GRPOBackbone=Llama-3.1-8B-Instruct2026.01 | 20.08 | 20.08 | |
| Prompt-UCBackbone=Llama-3.1-8B-Instruct2026.01 | 19.74 | 19.09 | |
| GRPO-UCBackbone=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.82026.01 | 15.79 | 2.24 | |
| BaselineBackbone=Llama-3.1-8B-Instruct2026.01 | 15.66 | 15.66 | |
| GRPO-UCBackbone=Llama-3.1-8B-Instruct, Reward Coefficient (ru)=0.22026.01 | 11.8 | 9.27 |