Math Reasoning on GSM8K
100Accuracy (GSM8K)GPT-5 high
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5 highInput Modality=Text, LLM-as-a-Judge=GPT-4o2025.11 | 100 | — | |
| Claude Sonnet 4.5Input Modality=Text, LLM-as-a-Judge=GPT-4o2025.11 | 100 | — | |
| Sora-2 AudioInput Modality=Audio, LLM-as-a-Judge=GPT-4o2025.11 | 98.9 | — | |
| Gemini 2.5 ProInput Modality=Text, LLM-as-a-Judge=GPT-4o2025.11 | 98.9 | — | |
| MathDivideModel=GPT-42026.04 | 96.8 | — | |
| QuaSARModel=GPT-42026.04 | 96.5 | — | |
| GWO/n=6+CoTModel=GPT-4o-mini2026.04 | 96.5 | — | |
| EGLR-OracleLModel=Qwen2.5-14B-Instruct2026.06 | 96.3 | — | |
| MathPrompterModel=GPT-42026.04 | 95.6 | — | |
| FCoTModel=GPT-42026.04 | 95 | — | |
| EGLR-OracleLModel=Llama-3.1-8B-Instruct2026.06 | 94.8 | — | |
| CoTModel=GPT-42026.04 | 94.5 | — | |
| EGLR-OracleLModel=Qwen2.5-Math-7B-Instruct2026.06 | 94.5 | — | |
| EGLR-OracleLModel=Qwen2.5-7B-Instruct2026.06 | 94.1 | — | |
| CoMATModel=GPT-42026.04 | 93.7 | — | |
| EGLR-SCL (B = 10)Model=Qwen2.5-14B-Instruct2026.06 | 93.5 | — | |
| EGLR-OracleLModel=Qwen2.5-3B-Instruct2026.06 | 93.1 | — | |
| EGLR (best L)Model=Qwen2.5-14B-Instruct2026.06 | 93 | — | |
| EGLR (best L)Model=Qwen2.5-Math-7B-Instruct2026.06 | 92.9 | — | |
| EGLR-SCL (B = 10)Model=Qwen2.5-Math-7B-Instruct2026.06 | 92.8 | — | |
| EGLR-OracleLModel=Qwen2.5-Math-1.5B-Instruct2026.06 | 92.5 | — | |
| GreedyModel=Qwen2.5-14B-Instruct2026.06 | 92.4 | — | |
| GreedyModel=Qwen2.5-Math-7B-Instruct2026.06 | 92.4 | — | |
| EGLR-SCL (B = 10)Model=Qwen2.5-7B-Instruct2026.06 | 89.7 | — | |
| EGLR (best L)Model=Qwen2.5-7B-Instruct2026.06 | 89.2 | — | |
| GreedyModel=Qwen2.5-7B-Instruct2026.06 | 89.1 | — | |
| SPARDModel=Qwen-2.5-14B-Instruct2026.05 | 88.93 | — | |
| SafeGradModel=Qwen-2.5-14B-Instruct2026.05 | 88.79 | — | |
| SFTModel=Qwen-2.5-14B-Instruct2026.05 | 88.63 | — | |
| Nemotron-Labs-Diffusion-8BGen. Mode=Quad. SS, Avg TPF=7.042026.07 | 88.48 | — | |
| Nemotron-Labs-Diffusion-8BGen. Mode=AR, Avg TPF=1.002026.07 | 88.25 | — | |
| Nemotron-Labs-Diffusion-8BGen. Mode=Linear SS, Avg TPF=4.672026.07 | 88.17 | — | |
| EGLR-SCL (B = 10)Model=Llama-3.1-8B-Instruct2026.06 | 87.9 | — | |
| Nemotron-Labs-Diffusion-8BGen. Mode=Diff., Avg TPF=2.062026.07 | 87.26 | — | |
| ARES-RLBackbone=Qwen3-32B2026.05 | 86.96 | — | |
| Qwen3-8BGen. Mode=AR, Avg TPF=1.002026.07 | 86.73 | — | |
| LisaModel=Qwen-2.5-14B-Instruct2026.05 | 86.54 | — | |
| ARES-SFTBackbone=Qwen3-32B2026.05 | 85.67 | — | |
| GreedyModel=Llama-3.1-8B-Instruct2026.06 | 85.4 | — | |
| EGLR-SCL (B = 10)Model=Qwen2.5-3B-Instruct2026.06 | 85.1 | — | |
| EGLR (best L)Model=Llama-3.1-8B-Instruct2026.06 | 85 | — | |
| WebscaleBackbone=Qwen3-32B2026.05 | 84.91 | — | |
| SafeGradModel=Qwen-3-8B2026.05 | 84.76 | — | |
| EGLR-SCL (B = 10)Model=Qwen2.5-Math-1.5B-Instruct2026.06 | 84.7 | — | |
| EGLR (best L)Model=Qwen2.5-Math-1.5B-Instruct2026.06 | 84.2 | — | |
| SPARDModel=Qwen-3-8B2026.05 | 83.92 | — | |
| SFTModel=Qwen-3-8B2026.05 | 83.39 | — | |
| GreedyModel=Qwen2.5-Math-1.5B-Instruct2026.06 | 83.3 | — | |
| GreedyModel=Qwen2.5-3B-Instruct2026.06 | 83.1 | — | |
| EGLR (best L)Model=Qwen2.5-3B-Instruct2026.06 | 83 | — | |
| CPTBackbone=Qwen3-32B2026.05 | 82.34 | — | |
| NaturalReasoningBackbone=Qwen3-32B2026.05 | 81.5 | — | |
| LisaModel=Qwen-3-8B2026.05 | 80.44 | — | |
| Ministral3-8BGen. Mode=AR, Avg TPF=1.002026.07 | 80.21 | — | |
| FourierMoEModel=Qwen2.5-14B, # Params(%)=0.052026.04 | 78.09 | — | |
| TopLoRAModel=Qwen2.5-14B, # Params(%)=0.102026.04 | 77.31 | — | |
| EGLR-OracleLModel=Mistral-7B-Instruct-v0.32026.06 | 77.3 | — | |
| Dream-7BGen. Mode=Diff., Avg TPF=1.002026.07 | 77.18 | — | |
| LLaDA 8B-Instruct (Top Probability + Suffix-Anchored Confidence Modulation)Model=LLaDA 8B-Instruct, Decoding Strategy=Top Probability, Suffix Anchor=true, Confidence Modulation=true2026.05 | 76.88 | — | |
| HydraLoRAModel=Qwen2.5-14B, # Params(%)=0.122026.04 | 76.32 | — | |
| DoRAModel=Qwen2.5-14B, # Params(%)=0.132026.04 | 75.92 | — | |
| MELoRAModel=Qwen2.5-14B, # Params(%)=0.122026.04 | 75.89 | — | |
| Sora-2 Last FrameInput Modality=Last Frame, LLM-as-a-Judge=GPT-4o2025.11 | 75.7 | — | |
| LoRAModel=Qwen2.5-14B, # Params(%)=0.122026.04 | 74.37 | — | |
| EGLR-OracleLModel=Qwen2.5-0.5B-Instruct2026.06 | 74 | — | |
| LLaDA 8B-Instruct (Top Margin + Suffix-Anchored Confidence Modulation)Model=LLaDA 8B-Instruct, Decoding Strategy=Top Margin, Suffix Anchor=true, Confidence Modulation=true2026.05 | 72.33 | — | |
| HyLo-Llama-14MLA14M2Teacher=8B, KV cache=4.7%, Training Context Length=8K, Backbone=Llama-3.2-3B2026.04 | 71 | — | |
| LLaDA-8BGen. Mode=Diff., Avg TPF=1.002026.07 | 70.96 | — | |
| LLaDA-8BParadigm=Masked Diffusion, Training Tokens=2.3T, Training Data=Not Released, Evaluation protocol=Reported by prior work, Shots=42026.06 | 70.3 | — | |
| HyLo-Llama-14MLA14GDNTeacher=8B, KV cache=4.7%, Training Context Length=8K, Backbone=Llama-3.2-3B2026.04 | 68.2 | — | |
| HyLo-Llama-6MLA22GDNTeacher=8B, KV cache=2.0%, Training Context Length=8K, Backbone=Llama-3.2-3B2026.04 | 68.1 | — | |
| LoRA-DABackbone=LLaMA 2-13B2025.10 | 66.4 | — | |
| HyLo-Llama-6MLA22M2Teacher=8B, KV cache=2.0%, Training Context Length=8K, Backbone=Llama-3.2-3B2026.04 | 66.3 | — | |
| Zebra-Llama 3B (14MLA-14M2)Teacher=8B, KV cache=4.7%, Training Context Length=Baseline, Backbone=Llama-3.2-3B2026.04 | 66.2 | — | |
| PiSSABackbone=LLaMA 2-13B2025.10 | 65.8 | — | |
| LoRA-OneBackbone=LLaMA 2-13B2025.10 | 65.5 | — | |
| MiLoRABackbone=LLaMA 2-13B2025.10 | 64.6 | — | |
| LoRABackbone=LLaMA 2-13B2025.10 | 64.3 | — | |
| M1KV cache=21.4%, Training Context Length=Baseline, Backbone=Llama-3.2-3B2026.04 | 62.5 | — | |
| BaselineBackbone=Qwen1.5-MoE-A2.7B, Type=–2026.06 | 61.5 | — | |
| Full FTRatio=0%, # Params=6.92B2026.03 | 61.2 | 56.3 | |
| FourierMoEModel=LLaMA-3 8B, # Params(%)=0.012026.04 | 60.8 | — | |
| Zebra-Llama 3B (6MLA-22M2)Teacher=8B, KV cache=2.0%, Training Context Length=Baseline, Backbone=Llama-3.2-3B2026.04 | 60.7 | — | |
| LoRARatio=0%, # Params=0.45B2026.03 | 59.8 | 55.5 | |
| LightMoERatio=30%, # Params=0.45B2026.03 | 59.7 | 55.3 | |
| MC-SMoERatio=30%, # Params=0.45B2026.03 | 59 | 53.4 | |
| HyLo-Llama-14MLA14GDNTeacher=8B, KV cache=4.7%, Training Context Length=64K, Backbone=Llama-3.2-3B2026.04 | 58.9 | — | |
| OursQBackbone=Qwen1.5-MoE-A2.7B, Sparsity=25%, Quantization=4-bit2026.06 | 58.5 | — | |
| OursBackbone=Qwen1.5-MoE-A2.7B, Sparsity=50%2026.06 | 58.2 | — | |
| LightMoERatio=40%, # Params=0.45B2026.03 | 57.9 | 53 | |
| Replace (w. shared)Ratio=30%, # Params=0.45B2026.03 | 57.8 | 52.3 | |
| Replace (w. shared)Ratio=40%, # Params=0.45B2026.03 | 57.7 | 49.3 | |
| LoRAModel=LLaMA-3 8B, # Params(%)=0.122026.04 | 57.22 | — | |
| Replace (w/o shared)Ratio=30%, # Params=0.45B2026.03 | 57.2 | 52.6 | |
| MC-SMoE*Ratio=40%, # Params=1.65B2026.03 | 57 | 50.2 | |
| Mamba in Llama-3B-50%Teacher=70B, KV cache=50.0%, Training Context Length=Baseline, Backbone=Llama-3.2-3B2026.04 | 56.8 | — | |
| EGLR-SCL (B = 10)Model=Mistral-7B-Instruct-v0.32026.06 | 56.6 | — | |
| DoRAModel=LLaMA-3 8B, # Params(%)=0.122026.04 | 56.52 | — | |
| LLaDA 8B-Instruct (Top Margin + Suffix Anchor)Model=LLaDA 8B-Instruct, Decoding Strategy=Top Margin, Suffix Anchor=true, Confidence Modulation=false2026.05 | 56.18 | — | |
| Replace (w/o shared)Ratio=40%, # Params=0.45B2026.03 | 56.1 | 50.1 |