Mathematical Reasoning on OlympiadBench (test)
51.8@1 Success RateLUFFY
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| LUFFYBase Model=Qwen2.5-Math-7B, Temperature=0.6, Max Generation Length=8,1922026.03 | 51.8 | — | — | — | — | |
| HAPOBase Model=Qwen2.5-Math-7B, Temperature=0.6, Max Generation Length=8,1922026.03 | 51.4 | — | — | — | — | |
| SRFTBase Model=Qwen2.5-Math-7B, Temperature=0.6, Max Generation Length=8,1922026.03 | 50 | — | — | — | — | |
| GRPOBase Model=Qwen2.5-Math-7B, Temperature=0.6, Max Generation Length=8,1922026.03 | 49.2 | — | — | — | — | |
| SFT-then-RLBase Model=Qwen2.5-Math-7B, Temperature=0.6, Max Generation Length=8,1922026.03 | 48.6 | — | — | — | — | |
| SFTBase Model=Qwen2.5-Math-7B, Temperature=0.6, Max Generation Length=8,1922026.03 | 43.2 | — | — | — | — | |
| TGR-LatentBackbone=Qwen3-8B2026.01 | 32.8 | 41.8 | 44.9 | 39.5 | 7 | |
| Dele-SimKOBackbone=Qwen3-8B2026.01 | 32.5 | 40.8 | 43.8 | 38.8 | 8.5 | |
| LCoT-SimKOBackbone=Qwen3-8B2026.01 | 31.8 | 36 | 38 | 35.1 | 8.6 | |
| Dele-GRPOBackbone=Qwen3-8B2026.01 | 31.5 | 39 | 41.8 | 37.2 | 8.4 | |
| LCoT-GRPOBackbone=Qwen3-8B2026.01 | 30.1 | 31.8 | 32.5 | 31.5 | 8.5 | |
| Qwen2.5-Math-7BTemperature=0.6, Max Generation Length=8,1922026.03 | 30 | — | — | — | — | |
| TGR-TokenBackbone=Qwen3-8B2026.01 | 29.1 | 37 | 39.5 | 34.8 | 7.5 | |
| PSamplingBackbone=Qwen3-8B2026.01 | 27.4 | 34.5 | 36.8 | 32.6 | 6 | |
| Base ModelBackbone=Qwen3-8B2026.01 | 22.1 | 30.2 | 32.6 | 27.9 | 2.6 |