Mathematical Reasoning on AMC 23 (Avg@8)
80.6Avg@8Legislator-Executor (Ours)
Evaluation Results
| Method | Links | |
|---|---|---|
| Legislator-Executor (Ours)Model=Qwen3-14B-Base, Decoding Strategy=8 sampling iterations2026.04 | 80.6 | |
| R1-Distill-Qwen-32B# Trainable Params=32B2025.10 | 76.9 | |
| S1KModel=Qwen3-14B-Base, Decoding Strategy=8 sampling iterations2026.04 | 75.9 | |
| DeepToolBackbone=Qwen3-4B, Training Stage=+RL2026.05 | 75.3 | |
| Legislator-Executor (Ours)Model=Qwen3-8B-Base, Decoding Strategy=8 sampling iterations2026.04 | 74.7 | |
| DeepToolBackbone=Qwen3-4B, Training Stage=SFT2026.05 | 74.4 | |
| Legislator-Executor (Ours)Model=Qwen2.5-7B-QwQ, Decoding Strategy=8 sampling iterations2026.04 | 70.6 | |
| LIMOModel=Qwen3-14B-Base, Decoding Strategy=8 sampling iterations2026.04 | 70 | |
| s1.1-32B# Trainable Params=32B2025.10 | 70 | |
| DeepToolBackbone=Qwen2.5-7B, Training Stage=SFT2026.05 | 68.1 | |
| ToRLBackbone=Qwen2.5-7B, Training Stage=RL-enhanced tool reasoning2026.05 | 67.5 | |
| BaseModel=Qwen3-14B-Base, Decoding Strategy=8 sampling iterations2026.04 | 66.6 | |
| Legislator-Executor (Ours)Model=Qwen2.5-Math-7B, Decoding Strategy=8 sampling iterations2026.04 | 65.3 | |
| Legislator-Executor (Ours)Model=Qwen3-4B-Base, Decoding Strategy=8 sampling iterations2026.04 | 65 | |
| DeepToolBackbone=Qwen2.5-7B, Training Stage=+RL2026.05 | 64 | |
| Target + THINKLOGIT-DPO# Trainable Params=78M2025.10 | 63.7 | |
| ReToolBackbone=Qwen2.5-7B, Training Stage=RL-enhanced tool reasoning2026.05 | 62.5 | |
| SimpleRL-Zoo-7BBackbone=Qwen2.5-7B, Training Stage=Zero-RL2026.05 | 62.5 | |
| Target + THINKLOGIT# Trainable Params=02025.10 | 62.2 | |
| LIMOModel=Qwen3-8B-Base, Decoding Strategy=8 sampling iterations2026.04 | 60.3 | |
| S1KModel=Qwen3-8B-Base, Decoding Strategy=8 sampling iterations2026.04 | 60.3 | |
| BaseModel=Qwen3-8B-Base, Decoding Strategy=8 sampling iterations2026.04 | 58.4 | |
| LIMOModel=Qwen2.5-7B-QwQ, Decoding Strategy=8 sampling iterations2026.04 | 57.5 | |
| Qwen2.5-32B# Trainable Params=-2025.10 | 57.2 | |
| LIMOModel=Qwen3-4B-Base, Decoding Strategy=8 sampling iterations2026.04 | 56.9 | |
| Legislator-Executor (Ours)Model=Qwen2.5-7B, Decoding Strategy=8 sampling iterations2026.04 | 55.9 | |
| BaseModel=Qwen2.5-7B-QwQ, Decoding Strategy=8 sampling iterations2026.04 | 55 | |
| S1KModel=Qwen2.5-7B-QwQ, Decoding Strategy=8 sampling iterations2026.04 | 55 | |
| S1KModel=Qwen3-4B-Base, Decoding Strategy=8 sampling iterations2026.04 | 53.1 | |
| R1-Distill-Qwen-1.5B# Trainable Params=-2025.10 | 51.2 | |
| DeepToolBackbone=Qwen3-4B, Training Stage=w/o thinking2026.05 | 50.9 | |
| BaseModel=Qwen3-4B-Base, Decoding Strategy=8 sampling iterations2026.04 | 50.3 | |
| S1KModel=Qwen2.5-Math-7B, Decoding Strategy=8 sampling iterations2026.04 | 49.7 | |
| Qwen3-4B-BaseBackbone=Qwen3-4B, Training Stage=Base2026.05 | 48.1 | |
| LIMOModel=Qwen2.5-Math-7B, Decoding Strategy=8 sampling iterations2026.04 | 47.2 | |
| LIMOModel=Qwen2.5-7B, Decoding Strategy=8 sampling iterations2026.04 | 45.9 | |
| DeepToolBackbone=Qwen2.5-7B, Training Stage=w/o thinking2026.05 | 45.6 | |
| Search-R1Backbone=Qwen2.5-7B, Training Stage=Search-based2026.05 | 45 | |
| S1KModel=Qwen2.5-7B, Decoding Strategy=8 sampling iterations2026.04 | 43.8 | |
| BaseModel=Qwen2.5-Math-7B, Decoding Strategy=8 sampling iterations2026.04 | 38.8 | |
| Search-o1Backbone=Qwen2.5-7B, Training Stage=Search-based2026.05 | 37.5 | |
| BaseModel=Qwen2.5-7B, Decoding Strategy=8 sampling iterations2026.04 | 36.9 | |
| Legislator-Executor (Ours)Model=Gemma-2-9B, Decoding Strategy=8 sampling iterations2026.04 | 23.8 | |
| Qwen2.5-7B-BaseBackbone=Qwen2.5-7B, Training Stage=Base2026.05 | 21.7 | |
| LIMOModel=Gemma-2-9B, Decoding Strategy=8 sampling iterations2026.04 | 20.6 | |
| S1KModel=Gemma-2-9B, Decoding Strategy=8 sampling iterations2026.04 | 20.3 | |
| Legislator-Executor (Ours)Model=Llama-3.1-8B, Decoding Strategy=8 sampling iterations2026.04 | 10.9 | |
| Qwen2.5-7B-TIRBackbone=Qwen2.5-7B, Training Stage=TIR2026.05 | 10.8 | |
| LIMOModel=Llama-3.1-8B, Decoding Strategy=8 sampling iterations2026.04 | 8.8 | |
| S1KModel=Llama-3.1-8B, Decoding Strategy=8 sampling iterations2026.04 | 7.8 | |
| BaseModel=Gemma-2-9B, Decoding Strategy=8 sampling iterations2026.04 | 7.5 | |
| BaseModel=Llama-3.1-8B, Decoding Strategy=8 sampling iterations2026.04 | 4.7 | |
| BaseModel=Llama-3.2-3B, Decoding Strategy=8 sampling iterations2026.04 | 3.8 | |
| Legislator-Executor (Ours)Model=Llama-3.2-3B, Decoding Strategy=8 sampling iterations2026.04 | 3.8 | |
| S1KModel=Llama-3.2-3B, Decoding Strategy=8 sampling iterations2026.04 | 3.4 | |
| Legislator-Executor (Ours)Model=Mistral-7B-v0.3, Decoding Strategy=8 sampling iterations2026.04 | 3.1 | |
| S1KModel=Mistral-7B-v0.3, Decoding Strategy=8 sampling iterations2026.04 | 2.8 | |
| LIMOModel=Llama-3.2-3B, Decoding Strategy=8 sampling iterations2026.04 | 2.5 | |
| BaseModel=Mistral-7B-v0.3, Decoding Strategy=8 sampling iterations2026.04 | 2.5 | |
| LIMOModel=Mistral-7B-v0.3, Decoding Strategy=8 sampling iterations2026.04 | 2.2 |