Math Reasoning on GSM8K (Accuracy, Token Count, AES)
93.8AccuracyS-GRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| S-GRPOModel Size=7B, Learning Paradigm=process-supervised RL2026.02 | 93.8 | 906 | -0.23 | |
| AbliterationBackbone=Qwen3-14B2026.02 | 92.7 | — | — | |
| ATTNPOModel Size=7B, Learning Paradigm=process-supervised RL2026.02 | 92.4 | 446 | 0.44 | |
| BaseBackbone=Qwen3-14B2026.02 | 92.1 | — | — | |
| GRP-OblitBackbone=Qwen3-14B2026.02 | 91.2 | — | — | |
| AutoThinkModel Size=7B, Learning Paradigm=adaptive-mode2026.02 | 91.1 | 866 | -0.26 | |
| TLMREModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 91.1 | 515 | 0.29 | |
| AdaptThinkModel Size=7B, Learning Paradigm=adaptive-mode2026.02 | 91 | 309 | 0.61 | |
| GRP-OblitBackbone=Qwen3-8B2026.02 | 89.2 | — | — | |
| GRP-OblitBackbone=Gemma3-12B2026.02 | 88.6 | — | — | |
| AbliterationBackbone=Qwen3-8B2026.02 | 88.6 | — | — | |
| TwinBreakBackbone=Qwen3-14B2026.02 | 88.5 | — | — | |
| ACPOModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 88.3 | 413 | 0.36 | |
| DS-7BModel Size=7B2026.02 | 88.2 | 639 | 0 | |
| LC-R1Model Size=7B, Learning Paradigm=process-supervised RL2026.02 | 88.1 | 450 | 0.29 | |
| GRP-Oblit-1Backbone=Gemma3-12B2026.02 | 87.6 | — | — | |
| BaseBackbone=Qwen3-8B2026.02 | 87.6 | — | — | |
| BaseBackbone=Gemma3-12B2026.02 | 87.4 | — | — | |
| Laser-DModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 87.3 | 804 | -0.31 | |
| TLMREModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 87.2 | 604 | 0.76 | |
| ATTNPOModel Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 87 | 393 | 0.95 | |
| AbliterationBackbone=DeepSeek-R1-Qwen-14B2026.02 | 87 | — | — | |
| GRP-Oblit-1Backbone=Qwen3-8B2026.02 | 86.5 | — | — | |
| TwinBreakBackbone=Gemma3-12B2026.02 | 86.3 | — | — | |
| GRP-Oblit-1Backbone=DeepSeek-R1-Qwen-14B2026.02 | 85.7 | — | — | |
| BaseBackbone=Ministral3-8B Instruct2026.02 | 85.1 | — | — | |
| BaseBackbone=Ministral3-14B Instruct2026.02 | 84.8 | — | — | |
| BaseBackbone=Llama3.1-8B2026.02 | 84.4 | — | — | |
| GRP-Oblit-1Backbone=Qwen2.5-14B2026.02 | 84.1 | — | — | |
| BaseBackbone=DeepSeek-R1-Qwen-14B2026.02 | 83.6 | — | — | |
| GRP-OblitBackbone=DeepSeek-R1-Qwen-14B2026.02 | 83.6 | — | — | |
| Laser-DModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 83.4 | 863 | 0.38 | |
| GRP-OblitBackbone=Llama3.1-8B2026.02 | 83.4 | — | — | |
| GRP-OblitBackbone=GPT-OSS-20B2026.02 | 83.3 | — | — | |
| AbliterationBackbone=Llama3.1-8B2026.02 | 83.2 | — | — | |
| AdaptThinkModel Size=1.5B, Learning Paradigm=adaptive-mode2026.02 | 83.1 | 480 | 0.72 | |
| AutoThinkModel Size=1.5B, Learning Paradigm=adaptive-mode2026.02 | 83 | 568 | 0.64 | |
| ThinkPruneModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 83 | 609 | 0.6 | |
| LC-R1Model Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 82.7 | 841 | 0.37 | |
| GRP-Oblit-1Backbone=GPT-OSS-20B2026.02 | 82.5 | — | — | |
| Laser-DEModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 82.2 | 789 | -0.57 | |
| BaseBackbone=DeepSeek-R1-Qwen-7B2026.02 | 81.7 | — | — | |
| GRP-OblitBackbone=Qwen2.5-14B2026.02 | 81.7 | — | — | |
| GRP-Oblit-1Backbone=DeepSeek-R1-Qwen-7B2026.02 | 81.4 | — | — | |
| ACPOModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 81.3 | 572 | 0.57 | |
| GRP-Oblit-1Backbone=Llama3.1-8B2026.02 | 81.3 | — | — | |
| GRP-OblitBackbone=DeepSeek-R1-Qwen-7B2026.02 | 80.8 | — | — | |
| GRP-Oblit-1Backbone=Gemma2-9B2026.02 | 80.6 | — | — | |
| Laser-DEModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 80.4 | 820 | 0.31 | |
| AbliterationBackbone=DeepSeek-R1-Qwen-7B2026.02 | 80.4 | — | — | |
| GRP-OblitBackbone=Ministral3-14B Instruct2026.02 | 80.1 | — | — | |
| AbliterationBackbone=DeepSeek-R1-Llama-8B2026.02 | 79.8 | — | — | |
| BaseBackbone=Gemma2-9B2026.02 | 79.6 | — | — | |
| AbliterationBackbone=Gemma2-9B2026.02 | 79.5 | — | — | |
| BaseBackbone=GPT-OSS-20B2026.02 | 79.1 | — | — | |
| DS-1.5BModel Size=1.5B2026.02 | 78.8 | 1,085 | 0 | |
| BaseBackbone=DeepSeek-R1-Llama-8B2026.02 | 78.6 | — | — | |
| AbliterationBackbone=GPT-OSS-20B2026.02 | 78.5 | — | — | |
| GRP-Oblit-1Backbone=Ministral3-8B Instruct2026.02 | 78.2 | — | — | |
| BaseBackbone=Qwen2.5-14B2026.02 | 78.1 | — | — | |
| GRP-OblitBackbone=DeepSeek-R1-Llama-8B2026.02 | 77.7 | — | — | |
| AbliterationBackbone=Qwen2.5-14B2026.02 | 77.3 | — | — | |
| FP16Model=Llama-3-8B2025.12 | 77.17 | — | — | |
| TwinBreakBackbone=DeepSeek-R1-Qwen-7B2026.02 | 76.6 | — | — | |
| GRP-OblitBackbone=Gemma2-9B2026.02 | 76.6 | — | — | |
| GRP-Oblit-1Backbone=Qwen2.5-7B2026.02 | 76 | — | — | |
| TwinBreakBackbone=Gemma2-9B2026.02 | 74.5 | — | — | |
| AbliterationBackbone=Qwen2.5-7B2026.02 | 74.4 | — | — | |
| CALMModel=Llama-3-8B2025.12 | 74.33 | — | — | |
| GRP-OblitBackbone=Ministral3-8B Instruct2026.02 | 74.1 | — | — | |
| TwinBreakBackbone=Qwen2.5-14B2026.02 | 73.8 | — | — | |
| GRP-Oblit-1Backbone=DeepSeek-R1-Llama-8B2026.02 | 73.7 | — | — | |
| SpinQuantModel=Llama-3-8B2025.12 | 73.56 | — | — | |
| GRP-OblitBackbone=Qwen2.5-7B2026.02 | 73.3 | — | — | |
| AWQModel=Llama-3-8B2025.12 | 72.94 | — | — | |
| SmoothQuantModel=Llama-3-8B2025.12 | 72.55 | — | — | |
| GRP-Oblit-1Backbone=Ministral3-14B Instruct2026.02 | 72.5 | — | — | |
| BaseBackbone=Qwen2.5-7B2026.02 | 72 | — | — | |
| GPTQModel=Llama-3-8B2025.12 | 71.89 | — | — | |
| TwinBreakBackbone=Qwen2.5-7B2026.02 | 71.2 | — | — | |
| GRP-Oblit-1Backbone=Qwen3-14B2026.02 | 70.6 | — | — | |
| FP16Model=Llama-3.2-3B2025.12 | 68.86 | — | — | |
| AbliterationBackbone=Gemma3-12B2026.02 | 67.2 | — | — | |
| TwinBreakBackbone=DeepSeek-R1-Llama-8B2026.02 | 61.6 | — | — | |
| CALMModel=Llama-3.2-3B2025.12 | 60.22 | — | — | |
| FP16Model=Qwen1.5-1.5B2025.12 | 58.03 | — | — | |
| SpinQuantModel=Llama-3.2-3B2025.12 | 57.93 | — | — | |
| AWQModel=Llama-3.2-3B2025.12 | 57.65 | — | — | |
| SmoothQuantModel=Llama-3.2-3B2025.12 | 56.33 | — | — | |
| GPTQModel=Llama-3.2-3B2025.12 | 55.75 | — | — | |
| TwinBreakBackbone=Llama3.1-8B2026.02 | 55.4 | — | — | |
| BaseBackbone=Ministral3-14B Reasoning2026.02 | 54.6 | — | — | |
| HySparse# Shots=8-shot, Model Architecture=80B MoE (Hybrid 1:11), Attention Variant=HySparse2026.02 | 54.1 | — | — | |
| Full-Attn# Shots=8-shot, Model Architecture=80B MoE (Hybrid 1:11), Attention Variant=Full-Attn2026.02 | 53.8 | — | — | |
| CALMModel=Qwen1.5-1.5B2025.12 | 51.36 | — | — | |
| SpinQuantModel=Qwen1.5-1.5B2025.12 | 49.01 | — | — | |
| SmoothQuantModel=Qwen1.5-1.5B2025.12 | 48.64 | — | — | |
| AWQModel=Qwen1.5-1.5B2025.12 | 48.32 | — | — | |
| GPTQModel=Qwen1.5-1.5B2025.12 | 47.12 | — | — | |
| Hybrid SWA# Shots=8-shot, Model Architecture=80B MoE (Hybrid 1:11), Attention Variant=Hybrid SWA2026.02 | 45.3 | — | — |