Mathematical Reasoning on AIME (Accuracy)
83.3AIME AccuracySTAR-1
Evaluation Results
| Method | Links | |
|---|---|---|
| STAR-1Backbone=Qwen3-14B2026.01 | 83.3 | |
| TopoDIMBase model=GPT-OSS-120B, Ada.=true, DIM.=true, Dec.=true2026.01 | 80.34 | |
| InstructBackbone=Qwen3-14B2026.01 | 80 | |
| SafeKeyBackbone=Qwen3-14B2026.01 | 80 | |
| G-DesignerBase model=GPT-OSS-120B, Ada.=true, DIM.=true, Dec.=false2026.01 | 78.62 | |
| AgentDropoutBase model=GPT-OSS-120B, Ada.=true, DIM.=false, Dec.=true2026.01 | 78.13 | |
| GPTSwarmBase model=GPT-OSS-120B, Ada.=true, DIM.=false, Dec.=false2026.01 | 77.41 | |
| ReasoningGuardBackbone=Qwen3-4B2026.01 | 76.7 | |
| ReasoningGuardBackbone=Qwen3-8B2026.01 | 76.7 | |
| ReasoningGuardBackbone=Qwen3-14B2026.01 | 76.7 | |
| Self-ReminderBackbone=Qwen3-14B2026.01 | 76.7 | |
| LLM-DebateBase model=GPT-OSS-120B, Ada.=false, DIM.=false, Dec.=false2026.01 | 75.38 | |
| VanillaBase model=GPT-OSS-120B, Ada.=false, DIM.=false, Dec.=false2026.01 | 74.77 | |
| InstructBackbone=Qwen3-4B2026.01 | 73.3 | |
| STAR-1Backbone=Qwen3-4B2026.01 | 73.3 | |
| InstructBackbone=Qwen3-8B2026.01 | 73.3 | |
| Self-ReminderBackbone=Qwen3-8B2026.01 | 73.3 | |
| Self-GuardBackbone=Qwen3-8B2026.01 | 73.3 | |
| Self-GuardBackbone=Qwen3-14B2026.01 | 73.3 | |
| Thought-ICSModel=OSS-20B2026.02 | 72 | |
| Thought-ICSModel=OSS-120B2026.02 | 70 | |
| Self-ReminderBackbone=Qwen3-4B2026.01 | 70 | |
| STAR-1Backbone=Qwen3-8B2026.01 | 70 | |
| TopoDIMBase model=DeepSeek-V3.2-251201:671B, Ada.=true, DIM.=true, Dec.=true2026.01 | 69.93 | |
| IIPCLLM=Llama 4 Maverick2026.02 | 69.77 | |
| G-DesignerBase model=DeepSeek-V3.2-251201:671B, Ada.=true, DIM.=true, Dec.=false2026.01 | 68.62 | |
| AgentDropoutBase model=DeepSeek-V3.2-251201:671B, Ada.=true, DIM.=false, Dec.=true2026.01 | 68.17 | |
| GPTSwarmBase model=DeepSeek-V3.2-251201:671B, Ada.=true, DIM.=false, Dec.=false2026.01 | 67.2 | |
| Thought-ICS-AModel=OSS-120B2026.02 | 67 | |
| Self-GuardBackbone=Qwen3-4B2026.01 | 66.7 | |
| SafeKeyBackbone=Qwen3-8B2026.01 | 66.7 | |
| MSV64Backbone=DeepSeek-R1-Distill-Llama-8B, Protocol=Best-of-64, Verifier=MSV642026.03 | 66.25 | |
| LLM-DebateBase model=DeepSeek-V3.2-251201:671B, Ada.=false, DIM.=false, Dec.=false2026.01 | 64.84 | |
| TAMELLM Backbone=GPT-5.22026.02 | 64.7 | |
| VanillaBase model=DeepSeek-V3.2-251201:671B, Ada.=false, DIM.=false, Dec.=false2026.01 | 64.37 | |
| IIPCLLM=Gemini 2.0 Flash2026.02 | 64.2 | |
| CoTBase model=DeepSeek-V3.2-251201:671B, Ada.=false, DIM.=false, Dec.=false2026.01 | 64.08 | |
| MSV1 + WVBackbone=DeepSeek-R1-Distill-Llama-8B, Protocol=Best-of-64, Verifier=MSV1 + Weighted Voting2026.03 | 63.86 | |
| Probe + WVBackbone=DeepSeek-R1-Distill-Llama-8B, Protocol=Best-of-64, Verifier=Probe + Weighted Voting2026.03 | 63.37 | |
| Thought-ICS-AModel=OSS-20B2026.02 | 63 | |
| PoTLLM=Llama 4 Maverick2026.02 | 62.49 | |
| CRLLM=Llama 4 Maverick2026.02 | 62.17 | |
| MACMLLM=Llama 4 Maverick2026.02 | 62.17 | |
| Thought-ICSModel=Qwen-32B2026.02 | 62 | |
| ProbeBackbone=DeepSeek-R1-Distill-Llama-8B, Protocol=Best-of-64, Verifier=Probe2026.03 | 61.04 | |
| MSV1Backbone=DeepSeek-R1-Distill-Llama-8B, Protocol=Best-of-64, Verifier=MSV12026.03 | 60.52 | |
| SafeChainBackbone=Qwen3-14B2026.01 | 60 | |
| ReasoningBackbone=Qwen2.5-7B family2026.01 | 60 | |
| PoTLLM=Gemini 2.0 Flash2026.02 | 59.16 | |
| ReasoningbankLLM Backbone=GPT-5.22026.02 | 58.7 | |
| SafeChainBackbone=Qwen3-4B2026.01 | 56.7 | |
| SafeChainBackbone=Qwen3-8B2026.01 | 56.7 | |
| No-MemoryLLM Backbone=GPT-5.22026.02 | 54 | |
| MementoLLM Backbone=GPT-5.22026.02 | 54 | |
| Thought-ICSModel=LLaMA-70B2026.02 | 54 | |
| CRLLM=Gemini 2.0 Flash2026.02 | 53.48 | |
| IIPCLLM=Mistral 3.2 24B2026.02 | 52.52 | |
| MV@10Model=LLaMA-70B2026.02 | 52 | |
| MACMLLM=Gemini 2.0 Flash2026.02 | 51.98 | |
| Reasoningbank+GuardLLM Backbone=GPT-5.22026.02 | 51.3 | |
| DCLLM Backbone=GPT-5.22026.02 | 50.7 | |
| IIPCLLM=Gemma 3 27B2026.02 | 50.48 | |
| DeepSeek-Qwen-7B (Full)Base Model=DeepSeek-Qwen-7B, Compression=None (Full Attention)2026.02 | 50 | |
| PoTLLM=Mistral 3.2 24B2026.02 | 48.12 | |
| Reasoningbank+promptLLM Backbone=GPT-5.22026.02 | 47.3 | |
| Thought-ICS-SModel=Qwen-32B2026.02 | 47 | |
| Thought-ICS-AModel=Qwen-32B2026.02 | 47 | |
| Token-ICSModel=LLaMA-70B2026.02 | 47 | |
| OmniKVBase Model=DeepSeek-Qwen-7B, Compression=OmniKV2026.02 | 46.7 | |
| PoTLLM=Gemma 3 27B2026.02 | 46.2 | |
| Thought-ICS-SModel=OSS-120B2026.02 | 46 | |
| CoVeModel=LLaMA-70B2026.02 | 45 | |
| Self-RefineModel=LLaMA-70B2026.02 | 44 | |
| DeltaKVBase Model=DeepSeek-Qwen-7B, Compression=DeltaKV2026.02 | 43.3 | |
| Thought-ICS-AModel=LLaMA-70B2026.02 | 42 | |
| CRLLM=Gemma 3 27B2026.02 | 41.69 | |
| MACMLLM=Gemma 3 27B2026.02 | 41.69 | |
| CRLLM=Mistral 3.2 24B2026.02 | 40.09 | |
| CoVeModel=OSS-20B2026.02 | 39 | |
| CoTModel=LLaMA-70B2026.02 | 39 | |
| InitModel=LLaMA-70B2026.02 | 39 | |
| TAMELLM Backbone=Qwen3-32B2026.02 | 38 | |
| Thought-ICS-SModel=LLaMA-70B2026.02 | 38 | |
| Thought-ICSModel=Qwen-14B2026.02 | 38 | |
| MACMLLM=Mistral 3.2 24B2026.02 | 37.62 | |
| DCLLM Backbone=Qwen3-32B2026.02 | 37.3 | |
| CoVeModel=OSS-120B2026.02 | 36 | |
| No-MemoryLLM Backbone=Qwen3-32B2026.02 | 35.3 | |
| Reasoningbank+promptLLM Backbone=Qwen3-32B2026.02 | 35.3 | |
| Token-ICSModel=Qwen-32B2026.02 | 35 | |
| ReasonAnyBackbone=Qwen2.5-7B family2026.01 | 33.33 | |
| MementoLLM Backbone=Qwen3-32B2026.02 | 33.3 | |
| SafeKeyBackbone=Qwen3-4B2026.01 | 33.3 | |
| SnapKVBase Model=DeepSeek-Qwen-7B, Compression=SnapKV2026.02 | 33.3 | |
| Token-ICSModel=OSS-120B2026.02 | 33 | |
| Thought-ICSModel=Qwen-7B2026.02 | 32 | |
| PoTLLM=GPT-4o-mini2026.02 | 31.4 | |
| Reasoningbank+GuardLLM Backbone=Qwen3-32B2026.02 | 31.3 | |
| CoVeModel=Qwen-32B2026.02 | 31 | |
| GSPO + LIEBackbone=Qwen3-4B-Base, Strategy=Length-Incentivized Exploration2026.02 | 30.5 |