Mathematical Reasoning on AIME 2024 (mean@8)
68.3Mean Score (k=8)SD-ZERO
Evaluation Results
| Method | Links | |
|---|---|---|
| SD-ZEROBase Model=Qwen3-4B-Instruct2026.04 | 68.3 | |
| SRTBase Model=Qwen3-4B-Instruct2026.04 | 66.7 | |
| RFTBase Model=Qwen3-4B-Instruct2026.04 | 64.2 | |
| SDFTBase Model=Qwen3-4B-Instruct2026.04 | 63.3 | |
| GRPOBase Model=Qwen3-4B-Instruct2026.04 | 62.5 | |
| SFTBase Model=Qwen3-4B-Instruct2026.04 | 61.7 | |
| SD-ZEROBase Model=Olmo-3-7B-Instruct2026.04 | 61.7 | |
| Qwen3-4B-InstructBase Model=Qwen3-4B-Instruct2026.04 | 59.6 | |
| SRTBase Model=Olmo-3-7B-Instruct2026.04 | 59.2 | |
| Olmo-3-7B-InstructBase Model=Olmo-3-7B-Instruct2026.04 | 56.7 | |
| RFTBase Model=Olmo-3-7B-Instruct2026.04 | 56.7 | |
| GRPOBase Model=Olmo-3-7B-Instruct2026.04 | 54.6 | |
| SDFTBase Model=Olmo-3-7B-Instruct2026.04 | 52.9 | |
| SFTBase Model=Olmo-3-7B-Instruct2026.04 | 51.3 | |
| R1-Distill-Qwen-32B# Trainable Params=32B2025.10 | 45.8 | |
| DeepToolBackbone=Qwen2.5-7B, Training Stage=+RL2026.05 | 40.4 | |
| DeepToolBackbone=Qwen3-4B, Training Stage=+RL2026.05 | 40 | |
| ZeroTIR-7BBackbone=Qwen2.5-7B, Training Stage=Zero-RL2026.05 | 39.6 | |
| Legislator-Executor (Ours)Model=Qwen3-14B-Base, Decoding Strategy=8 sampling iterations2026.04 | 38.8 | |
| DeepToolBackbone=Qwen2.5-7B, Training Stage=SFT2026.05 | 38.3 | |
| S1KModel=Qwen3-14B-Base, Decoding Strategy=8 sampling iterations2026.04 | 37.9 | |
| DeepToolBackbone=Qwen3-4B, Training Stage=SFT2026.05 | 36.2 | |
| LIMOModel=Qwen3-14B-Base, Decoding Strategy=8 sampling iterations2026.04 | 33.8 | |
| s1.1-32B# Trainable Params=32B2025.10 | 32.9 | |
| PACED Reverse KLTrack=Self-distillation, Backbone=Qwen2.5-Math-7B-Instruct, KL Family=Reverse KL2026.03 | 31.6 | |
| ToRLBackbone=Qwen2.5-7B, Training Stage=RL-enhanced tool reasoning2026.05 | 30 | |
| ARPO-7BBackbone=Qwen2.5-7B, Training Stage=RL-enhanced tool reasoning2026.05 | 30 | |
| Hard Filter Reverse KLTrack=Self-distillation, Backbone=Qwen2.5-Math-7B-Instruct, KL Family=Reverse KL2026.03 | 28.9 | |
| AKLTrack=Self-distillation, Backbone=Qwen2.5-Math-7B-Instruct, KL Family=Reverse KL2026.03 | 28.2 | |
| Legislator-Executor (Ours)Model=Qwen2.5-7B-QwQ, Decoding Strategy=8 sampling iterations2026.04 | 27.5 | |
| Legislator-Executor (Ours)Model=Qwen3-8B-Base, Decoding Strategy=8 sampling iterations2026.04 | 27.1 | |
| Reverse KL (unweighted)Track=Self-distillation, Backbone=Qwen2.5-Math-7B-Instruct, KL Family=Reverse KL2026.03 | 25.3 | |
| ReToolBackbone=Qwen2.5-7B, Training Stage=RL-enhanced tool reasoning2026.05 | 23.3 | |
| Target + THINKLOGIT# Trainable Params=02025.10 | 22.5 | |
| Target + THINKLOGIT-DPO# Trainable Params=78M2025.10 | 22.1 | |
| BaseTrack=Self-distillation, Backbone=Qwen2.5-Math-7B-Instruct, KL Family=Reverse KL2026.03 | 19.6 | |
| LIMOModel=Qwen3-8B-Base, Decoding Strategy=8 sampling iterations2026.04 | 19.6 | |
| S1KModel=Qwen3-8B-Base, Decoding Strategy=8 sampling iterations2026.04 | 19.2 | |
| Legislator-Executor (Ours)Model=Qwen3-4B-Base, Decoding Strategy=8 sampling iterations2026.04 | 19.2 | |
| Legislator-Executor (Ours)Model=Qwen2.5-Math-7B, Decoding Strategy=8 sampling iterations2026.04 | 18.8 | |
| BaseModel=Qwen2.5-7B-QwQ, Decoding Strategy=8 sampling iterations2026.04 | 17.9 | |
| S1KModel=Qwen2.5-7B-QwQ, Decoding Strategy=8 sampling iterations2026.04 | 17.9 | |
| BaseModel=Qwen3-8B-Base, Decoding Strategy=8 sampling iterations2026.04 | 17.5 | |
| DeepToolBackbone=Qwen3-4B, Training Stage=w/o thinking2026.05 | 17.1 | |
| S1KModel=Qwen3-4B-Base, Decoding Strategy=8 sampling iterations2026.04 | 16.7 | |
| Search-R1Backbone=Qwen2.5-7B, Training Stage=Search-based2026.05 | 16.7 | |
| LIMOModel=Qwen2.5-7B-QwQ, Decoding Strategy=8 sampling iterations2026.04 | 16.2 | |
| R1-Distill-Qwen-1.5B# Trainable Params=-2025.10 | 16.2 | |
| SimpleRL-Zoo-7BBackbone=Qwen2.5-7B, Training Stage=Zero-RL2026.05 | 15.6 | |
| BaseModel=Qwen3-14B-Base, Decoding Strategy=8 sampling iterations2026.04 | 15 | |
| DeepToolBackbone=Qwen2.5-7B, Training Stage=w/o thinking2026.05 | 15 | |
| Qwen2.5-32B# Trainable Params=-2025.10 | 14.6 | |
| Legislator-Executor (Ours)Model=Qwen2.5-7B, Decoding Strategy=8 sampling iterations2026.04 | 14.2 | |
| LIMOModel=Qwen3-4B-Base, Decoding Strategy=8 sampling iterations2026.04 | 13.8 | |
| S1KModel=Qwen2.5-7B, Decoding Strategy=8 sampling iterations2026.04 | 11.7 | |
| BaseModel=Qwen2.5-Math-7B, Decoding Strategy=8 sampling iterations2026.04 | 11.7 | |
| S1KModel=Qwen2.5-Math-7B, Decoding Strategy=8 sampling iterations2026.04 | 11.7 | |
| LIMOModel=Qwen2.5-Math-7B, Decoding Strategy=8 sampling iterations2026.04 | 10.8 | |
| BaseModel=Qwen3-4B-Base, Decoding Strategy=8 sampling iterations2026.04 | 10.4 | |
| LIMOModel=Qwen2.5-7B, Decoding Strategy=8 sampling iterations2026.04 | 10 | |
| Qwen3-4B-BaseBackbone=Qwen3-4B, Training Stage=Base2026.05 | 7.1 | |
| Search-o1Backbone=Qwen2.5-7B, Training Stage=Search-based2026.05 | 6.7 | |
| BaseModel=Qwen2.5-7B, Decoding Strategy=8 sampling iterations2026.04 | 5.4 | |
| Qwen2.5-7B-BaseBackbone=Qwen2.5-7B, Training Stage=Base2026.05 | 3.2 | |
| Legislator-Executor (Ours)Model=Gemma-2-9B, Decoding Strategy=8 sampling iterations2026.04 | 2.9 | |
| LIMOModel=Gemma-2-9B, Decoding Strategy=8 sampling iterations2026.04 | 2.1 | |
| Qwen2.5-7B-TIRBackbone=Qwen2.5-7B, Training Stage=TIR2026.05 | 1.7 | |
| S1KModel=Gemma-2-9B, Decoding Strategy=8 sampling iterations2026.04 | 1.2 | |
| Legislator-Executor (Ours)Model=Llama-3.1-8B, Decoding Strategy=8 sampling iterations2026.04 | 0.8 | |
| Legislator-Executor (Ours)Model=Mistral-7B-v0.3, Decoding Strategy=8 sampling iterations2026.04 | 0.4 | |
| BaseModel=Gemma-2-9B, Decoding Strategy=8 sampling iterations2026.04 | 0.4 | |
| BaseModel=Llama-3.1-8B, Decoding Strategy=8 sampling iterations2026.04 | 0 | |
| LIMOModel=Llama-3.1-8B, Decoding Strategy=8 sampling iterations2026.04 | 0 | |
| S1KModel=Llama-3.1-8B, Decoding Strategy=8 sampling iterations2026.04 | 0 | |
| BaseModel=Llama-3.2-3B, Decoding Strategy=8 sampling iterations2026.04 | 0 | |
| LIMOModel=Llama-3.2-3B, Decoding Strategy=8 sampling iterations2026.04 | 0 | |
| S1KModel=Llama-3.2-3B, Decoding Strategy=8 sampling iterations2026.04 | 0 | |
| Legislator-Executor (Ours)Model=Llama-3.2-3B, Decoding Strategy=8 sampling iterations2026.04 | 0 | |
| BaseModel=Mistral-7B-v0.3, Decoding Strategy=8 sampling iterations2026.04 | 0 | |
| LIMOModel=Mistral-7B-v0.3, Decoding Strategy=8 sampling iterations2026.04 | 0 | |
| S1KModel=Mistral-7B-v0.3, Decoding Strategy=8 sampling iterations2026.04 | 0 |