Mathematical Reasoning on AIME 24 (Acc, Tok, ReL)
71.1AccuracyTALE
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| TALEModel=Qwen3-14B2026.02 | 71.1 | 10,860 | — | 4 | |
| ReToolSize=32B2025.12 | 70.1 | — | — | — | |
| CGRSModel=Qwen3-14B2026.02 | 70 | 8,662 | — | 23.5 | |
| NEATModel=Qwen3-14B2026.02 | 70 | 9,426 | — | 16.7 | |
| TALEModel=Qwen3-8B2026.02 | 68.9 | 10,942 | — | 8.2 | |
| VanillaModel=Qwen3-14B2026.02 | 68.9 | 11,316 | — | — | |
| AutoTool (Qwen3-8B)Size=8B, Backbone=Qwen32025.12 | 68.8 | — | — | — | |
| DeepSeek-R1-Distill-Qwen-14BSize=14B2025.12 | 65.9 | — | — | — | |
| DynasorModel=Qwen3-14B2026.02 | 65.6 | 9,775 | — | 13.6 | |
| DynasorModel=Qwen3-8B2026.02 | 62.2 | 10,174 | — | 14.7 | |
| VanillaModel=Qwen3-8B2026.02 | 61.1 | 11,924 | — | — | |
| CGRSModel=Qwen3-8B2026.02 | 61.1 | 8,792 | — | 26.3 | |
| NEATModel=Qwen3-8B2026.02 | 60 | 9,067 | — | 24 | |
| DEERModel=Qwen3-14B2026.02 | 56.7 | 6,755 | — | 40.3 | |
| STAPOBase Model=Qwen3-14B, Evaluation Setting=JustRL2026.02 | 54.27 | — | — | — | |
| NEATModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 53.3 | 8,321 | — | 22 | |
| VanillaModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 52.2 | 10,662 | — | — | |
| CGRSModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 52.2 | 7,597 | — | 28.8 | |
| JustRLBase Model=Qwen3-14B, Evaluation Setting=JustRL2026.02 | 52.08 | — | — | — | |
| 20-EntropyBase Model=Qwen3-14B, Evaluation Setting=JustRL2026.02 | 51.25 | — | — | — | |
| TALEModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 48.9 | 9,727 | — | 8.8 | |
| DynasorModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 47.8 | 8,334 | — | 21.8 | |
| DEERModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 47.8 | 9,288 | — | 12.9 | |
| CGRSModel=DeepSeek-R1-Distill-Llama-8B2026.02 | 47.8 | 9,536 | — | 9.9 | |
| QwQ-32BSize=32B2025.12 | 47.3 | — | — | — | |
| STAPOBase Model=Qwen3-14B, Evaluation Setting=Training-Aligned2026.02 | 46.98 | — | — | — | |
| DEEP-GRPO-7BParameter size=7B2026.02 | 46.7 | — | — | — | |
| DEERModel=Qwen3-8B2026.02 | 45.6 | 7,443 | — | 37.6 | |
| NEATModel=DeepSeek-R1-Distill-Llama-8B2026.02 | 45.5 | 8,596 | — | 18.8 | |
| AutoTool (Qwen2.5-VL-7B)Size=7B, Backbone=Qwen2.5-VL2025.12 | 45.3 | — | — | — | |
| VanillaModel=DeepSeek-R1-Distill-Llama-8B2026.02 | 44.9 | 10,585 | — | — | |
| OursBackbone=Qwen2.5-7B2026.02 | 43.3 | 13,017 | 434.8 | — | |
| Oat-Zero-7B (Dr. GRPO)Parameter size=7B2026.02 | 43.3 | — | — | — | |
| DEERModel=DeepSeek-R1-Distill-Llama-8B2026.02 | 42.2 | 9,778 | — | 7.6 | |
| GRPOBase Model=Qwen3-14B, Evaluation Setting=Training-Aligned2026.02 | 42.19 | — | — | — | |
| 20-EntropyBase Model=Qwen3-14B, Evaluation Setting=Training-Aligned2026.02 | 42.08 | — | — | — | |
| GRPOBase Model=Qwen3-14B, Evaluation Setting=JustRL2026.02 | 40.52 | — | — | — | |
| Ours (Base)Backbone=Qwen2.5-7B2026.02 | 40 | 12,901 | 522.1 | — | |
| NoThinkingModel=DeepSeek-R1-Distill-Llama-8B2026.02 | 40 | 11,242 | — | -6.2 | |
| TALEModel=DeepSeek-R1-Distill-Llama-8B2026.02 | 40 | 11,141 | — | -5.3 | |
| STAPOBase Model=Qwen3-8B, Evaluation Setting=JustRL2026.02 | 39.48 | — | — | — | |
| DynasorModel=DeepSeek-R1-Distill-Llama-8B2026.02 | 37.7 | 10,368 | — | 2.1 | |
| JustRLBase Model=Qwen3-14B, Evaluation Setting=Training-Aligned2026.02 | 37.4 | — | — | — | |
| INFTYTHINKBackbone=Qwen2.5-7B2026.02 | 36.7 | 15,094 | 508.7 | — | |
| 20-EntropyBase Model=Qwen3-8B, Evaluation Setting=JustRL2026.02 | 35.1 | — | — | — | |
| JustRLBase Model=Qwen3-8B, Evaluation Setting=JustRL2026.02 | 34.06 | — | — | — | |
| STAPOBase Model=Qwen3-8B, Evaluation Setting=Training-Aligned2026.02 | 33.44 | — | — | — | |
| SepLLMBackbone=Qwen2.5-7B2026.02 | 33.3 | 13,100 | 484.7 | — | |
| LightThinkerBackbone=Qwen2.5-7B2026.02 | 33.3 | 13,307 | 449 | — | |
| GPG-7BParameter size=7B2026.02 | 33.3 | — | — | — | |
| GRPOBase Model=Qwen3-8B, Evaluation Setting=JustRL2026.02 | 32.4 | — | — | — | |
| NoThinkingModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 32.2 | 6,680 | — | 37.3 | |
| Qwen2.5-Math-72B-InstructSize=72B2025.12 | 31.3 | — | — | — | |
| GRPOBase Model=Qwen3-8B, Evaluation Setting=Training-Aligned2026.02 | 31.25 | — | — | — | |
| 20-EntropyBase Model=Qwen3-8B, Evaluation Setting=Training-Aligned2026.02 | 31.25 | — | — | — | |
| H2OBackbone=Qwen2.5-7B2026.02 | 30 | 13,274 | 448.9 | — | |
| NoThinkingModel=Qwen3-8B2026.02 | 30 | 5,967 | — | 50 | |
| NoThinkingModel=Qwen3-14B2026.02 | 27.8 | 3,689 | — | 67.4 | |
| OursBackbone=Qwen2.5-1.5B2026.02 | 26.7 | 13,610 | 440.13 | — | |
| DEEP-GRPO-1.5BParameter size=1.5B2026.02 | 26.7 | — | — | — | |
| SimpleRL-Zero-7BParameter size=7B2026.02 | 26.7 | — | — | — | |
| JustRLBase Model=Qwen3-8B, Evaluation Setting=Training-Aligned2026.02 | 25.21 | — | — | — | |
| NPG-Muse-8BPass@k protocol=avg@642025.08 | 23.6 | — | — | — | |
| TTSVModel=Qwen2.5-Math-7B, Test-Time Adaptation Method=TTSV2025.12 | 23.33 | — | — | — | |
| SDAR (RCD)Model Scale=8B, Block Size=32, Sequence Length=16384, Confidence Threshold=0.852026.01 | 21.46 | — | — | — | |
| Ours (Base)Backbone=Qwen2.5-1.5B2026.02 | 20 | 13,765 | 536.8 | — | |
| SLOTModel=Qwen2.5-Math-7B, Test-Time Adaptation Method=SLOT2025.12 | 20 | — | — | — | |
| Oat-Zero-1.5B (Dr. GRPO)Parameter size=1.5B2026.02 | 20 | — | — | — | |
| GPT4oSize=-2025.12 | 18.2 | — | — | — | |
| STAPOBase Model=Qwen3-1.7B, Evaluation Setting=Training-Aligned2026.02 | 17.4 | — | — | — | |
| LightThinkerBackbone=Qwen2.5-1.5B2026.02 | 16.7 | 13,827 | 461.6 | — | |
| INFTYTHINKBackbone=Qwen2.5-1.5B2026.02 | 16.7 | 16,318 | 566.2 | — | |
| Qwen2.5-Math-1.5BParameter size=1.5B2026.02 | 16.7 | — | — | — | |
| Qwen2.5-Math-7BParameter size=7B2026.02 | 16.7 | — | — | — | |
| PRIME-Zero-7BParameter size=7B2026.02 | 16.7 | — | — | — | |
| Eurus-7BParameter size=7B2026.02 | 16.7 | — | — | — | |
| Qwen3-4B-Base + RLBase Model=Qwen3-4B, Optimization Method=RL, Training Dataset=DeepScaleR2025.11 | 16.7 | — | — | — | |
| STAPOBase Model=Qwen3-1.7B, Evaluation Setting=JustRL2026.02 | 16.04 | — | — | — | |
| SDAR (RCD)Model Scale=8B, Block Size=64, Sequence Length=16384, Confidence Threshold=0.852026.01 | 15 | — | — | — | |
| JustRLBase Model=Qwen3-1.7B, Evaluation Setting=JustRL2026.02 | 14.58 | — | — | — | |
| Qwen3-14B-BasePass@k protocol=avg@642025.08 | 14.3 | — | — | — | |
| 20-EntropyBase Model=Qwen3-1.7B, Evaluation Setting=JustRL2026.02 | 13.85 | — | — | — | |
| SDAR (RCD)Model Scale=4B, Block Size=64, Sequence Length=16384, Confidence Threshold=0.852026.01 | 13.75 | — | — | — | |
| Qwen2.5-Math-7BModel=Qwen2.5-Math-7B, Test-Time Adaptation Method=None (Zero-Shot)2025.12 | 13.33 | — | — | — | |
| 20-EntropyBase Model=Qwen3-1.7B, Evaluation Setting=Training-Aligned2026.02 | 13.33 | — | — | — | |
| H2OBackbone=Qwen2.5-1.5B2026.02 | 13.3 | 13,921 | 462.2 | — | |
| SepLLMBackbone=Qwen2.5-1.5B2026.02 | 13.3 | 13,690 | 452.6 | — | |
| OpenReasoner-Zero-7B @ 3kParameter size=7B, Inference budget=3k2026.02 | 13.3 | — | — | — | |
| OpenReasoner-Zero-7B @ 8kParameter size=7B, Inference budget=8k2026.02 | 13.3 | — | — | — | |
| Qwen3-4B-Base + EGGROLLBase Model=Qwen3-4B, Optimization Method=EGGROLL, Training Dataset=DeepScaleR2025.11 | 13.3 | — | — | — | |
| Qwen2.5-14B-Instruct-1MPass@k protocol=avg@642025.08 | 13.1 | — | — | — | |
| Search-R1Size=7B2025.12 | 12.1 | — | — | — | |
| SDAR (SeqD)Model Scale=8B, Block Size=32, Sequence Length=16384, Confidence Threshold=0.852026.01 | 11.67 | — | — | — | |
| Qwen3-8B-BasePass@k protocol=avg@642025.08 | 11.5 | — | — | — | |
| SDAR (RCD)Model Scale=4B, Block Size=32, Sequence Length=16384, Confidence Threshold=0.852026.01 | 11.04 | — | — | — | |
| GRPOBase Model=Qwen3-1.7B, Evaluation Setting=JustRL2026.02 | 10.83 | — | — | — | |
| SLOTModel=Qwen2.5-Math-1.5B, Test-Time Adaptation Method=SLOT2025.12 | 10 | — | — | — | |
| Qwen2.5-Math-1.5B-InstructParameter size=1.5B2026.02 | 10 | — | — | — | |
| Qwen3-4B-BaseBase Model=Qwen3-4B, Optimization Method=None2025.11 | 10 | — | — | — | |
| JustRLBase Model=Qwen3-1.7B, Evaluation Setting=Training-Aligned2026.02 | 8.85 | — | — | — |