Mathematical Reasoning on OlympiadBench (Pass@1)
38.2Pass@1UFO
Evaluation Results
| Method | Links | |
|---|---|---|
| UFOBackbone=Qwen, Model Size=7B2026.01 | 38.2 | |
| GRPOBackbone=Qwen, Model Size=7B2026.01 | 37.9 | |
| DoPRBackbone=Qwen, Model Size=7B2026.01 | 37.9 | |
| GRPOBackbone=Qwen, Model Size=1.5B2026.01 | 34.2 | |
| DoPRBackbone=Qwen, Model Size=1.5B2026.01 | 33.9 | |
| UFOBackbone=Qwen, Model Size=1.5B2026.01 | 33.5 | |
| One-Shot RLBackbone=Qwen, Model Size=7B2026.01 | 32.1 | |
| One-Shot RLBackbone=Qwen, Model Size=1.5B2026.01 | 29.8 | |
| Qwen2.5-baseModel Size=7B, RL Strategy=Base2026.01 | 27.4 | |
| Qwen2.5-Math-baseModel Size=7B, RL Strategy=Base2026.01 | 14.4 | |
| Qwen2.5-Math-baseModel Size=1.5B, RL Strategy=Base2026.01 | 13.3 | |
| UFOBackbone=LLaMA, Model Size=8B2026.01 | 8.1 | |
| One-Shot RLBackbone=LLaMA, Model Size=8B2026.01 | 7.7 | |
| DoPRBackbone=LLaMA, Model Size=8B2026.01 | 7.7 | |
| GRPOBackbone=LLaMA, Model Size=8B2026.01 | 6.5 | |
| Qwen2.5-baseModel Size=1.5B, RL Strategy=Base2026.01 | 2.4 |