Mathematical Reasoning on OlympiadBench (test) (Acc, Len, AE)
43.2AccuracyGRPO+CLORE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GRPO+CLOREBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 43.2 | 3,245 | 0.76 | |
| DAPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 42.9 | 3,333 | 0.7 | |
| DAPO+CLOREBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 42.9 | 2,564 | 1.21 | |
| Training EfficientBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 42.8 | 3,802 | 0.49 | |
| ThinkPrune+CLOREBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 42.8 | 3,002 | 0.88 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 42.1 | 4,200 | 0.32 | |
| Training Efficient+CLOREBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 41.5 | 3,079 | 0.78 | |
| ThinkPruneBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 39.7 | 3,694 | 0.42 | |
| GRPO+CLOREBackbone=Qwen2.5-Math-7B2026.05 | 38.3 | 631 | 3.21 | |
| Base model (w/o training)Backbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 38 | 5,007 | — | |
| ThinkPruneBackbone=Qwen2.5-Math-7B2026.05 | 36.4 | 820 | 2.08 | |
| DAPO+CLOREBackbone=Qwen2.5-Math-7B2026.05 | 35.7 | 604 | 3.1 | |
| Training Efficient+CLOREBackbone=Qwen2.5-Math-7B2026.05 | 35.3 | 262 | 8.33 | |
| ThinkPrune+CLOREBackbone=Qwen2.5-Math-7B2026.05 | 34.2 | 560 | 3.23 | |
| GRPOBackbone=Qwen2.5-Math-7B2026.05 | 32.5 | 1,012 | 1.23 | |
| Training EfficientBackbone=Qwen2.5-Math-7B2026.05 | 32.5 | 358 | 5.29 | |
| DAPOBackbone=Qwen2.5-Math-7B2026.05 | 28.5 | 631 | 2.13 | |
| Base model (w/o training)Backbone=Qwen2.5-Math-7B2026.05 | 16.1 | 1,116 | — |