Mathematical Reasoning on AIME 2024 (test)
96.67AccuracyTeam-of-Thoughts
Evaluation Results
| Method | Links | ||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Team-of-Thoughtsorchestrator=DeepSeek v3.2, context window=16,384 tokens2026.02 | 96.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Majority Votingcontext window=20,000 tokens2026.02 | 93.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-5 Minicontext window=20,000 tokens2026.02 | 86.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini 3 Flashcontext window=20,000 tokens2026.02 | 86.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek v3.2context window=20,000 tokens2026.02 | 86.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-vl 235Bcontext window=20,000 tokens2026.02 | 83.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Hard cutoffLimit=10k2026.05 | 82.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 38.6 | — | — | — | — | — | — | — | — | — | — | |
| Hard cutoffLimit=12k2026.05 | 80.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 29.9 | — | — | — | — | — | — | — | — | — | — | |
| AgentVersecontext window=20,000 tokens2026.02 | 80 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek r1Model Type=Open Weights, Fine-tuning examples=>800K2025.01 | 79.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Burst-onlytype=completed-trace2026.05 | 77.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 47.4 | — | — | — | — | — | — | — | — | — | — | |
| Completed hybrid2026.05 | 77.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 44.8 | — | — | — | — | — | — | — | — | — | — | |
| LessIsMoreToken Budget (K)=6000, Backbone=Qwen3-8B2025.08 | 76.7 | — | — | — | 15.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CATBackbone=Qwen3-8B2026.07 | 76.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 11,774 | 9,866 | 18.4 | 18.2 | — | — | |
| Claude Sonnet 4.5context window=20,000 tokens2026.02 | 76.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OPSDModel Scale=Qwen3-4B, Temperature=1.0, Maximum generation length=32,768, Sample count (k)=162026.06 | 76 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LessIsMoreToken Budget (K)=4000, Backbone=Qwen3-8B2025.08 | 75.8 | — | — | — | 14.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RA-RFTModel Scale=Qwen3-4B, Temperature=1.0, Maximum generation length=32,768, Sample count (k)=322026.06 | 75.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DASTBackbone=Qwen3-8B2026.07 | 75.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 13,433 | 10,252 | 7 | 15 | — | — | |
| GRPOModel Scale=Qwen3-4B, Temperature=1.0, Maximum generation length=32,768, Sample count (k)=322026.06 | 74.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full AttentionToken Budget (K)=2000, Backbone=Qwen3-8B2025.08 | 74.5 | — | — | — | 14.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full AttentionToken Budget (K)=4000, Backbone=Qwen3-8B2025.08 | 74.5 | — | — | — | 14.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full AttentionToken Budget (K)=6000, Backbone=Qwen3-8B2025.08 | 74.5 | — | — | — | 14.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| o1Model Type=API only, Fine-tuning examples=N.A.2025.01 | 74.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-8BBackbone=Qwen3-8B2026.07 | 74.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 14,437 | 12,060 | — | — | — | — | |
| ConCISESimPOBackbone=Qwen3-8B2026.07 | 74.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 10,190 | 7,961 | 29.4 | 34 | — | — | |
| SeerAttention-rToken Budget (K)=6000, Backbone=Qwen3-8B2025.08 | 74.1 | — | — | — | 15.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AsyncNPUs=48, GBS=32, MBS=12025.11 | 73.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | 123.999 | 33.449 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LessIsMoreToken Budget (K)=2000, Backbone=Qwen3-8B2025.08 | 73.8 | — | — | — | 15.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OverThinkSimPOBackbone=Qwen3-8B2026.07 | 73.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 10,545 | 7,960 | 27 | 34 | — | — | |
| No filter2026.05 | 73.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 0 | — | — | — | — | — | — | — | — | — | — | |
| r1-distillModel Type=Open Weights, Fine-tuning examples=800K2025.01 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SyncNPUs=48, GBS=32, MBS=12025.11 | 72.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | 123.613 | 26.219 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Hard cutoffLimit=8k2026.05 | 71.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 49.9 | — | — | — | — | — | — | — | — | — | — | |
| MindSpeed-RLNPUs=64, GBS=32, MBS=12025.11 | 71.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | 107.874 | 6.627 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SeerAttention-rToken Budget (K)=4000, Backbone=Qwen3-8B2025.08 | 71.4 | — | — | — | 16.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TidalDecodeToken Budget (K)=6000, Backbone=Qwen3-8B2025.08 | 71.3 | — | — | — | 15.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoDiQ-L3-4BParameters=4B, Curriculum Stage=L32026.02 | 70.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Base (Instruct)Model Scale=Qwen3-4B, Temperature=1.0, Maximum generation length=32,768, Sample count (k)=322026.06 | 70.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| o1-miniModel Type=API only, Fine-tuning examples=N.A.2025.01 | 70 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SyncNPUs=64, GBS=64, MBS=12025.11 | 70 | — | — | — | — | — | — | — | — | — | — | — | — | — | 185.796 | 46.519 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TidalDecodeToken Budget (K)=4000, Backbone=Qwen3-8B2025.08 | 70 | — | — | — | 16.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Base model (32B)2025.11 | 69.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AsyncNPUs=64, GBS=64, MBS=12025.11 | 67.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | 188.081 | 77.342 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoDiQ-L2-4BParameters=4B, Curriculum Stage=L22026.02 | 66.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| A3POModel=Deepseek-R1-Distill-Qwen-7B2025.12 | 65.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoDiQ-L1-4BParameters=4B, Curriculum Stage=L12026.02 | 65 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-RL-4BParameters=4B, Type=Baseline, Training=Reinforcement Learning2026.02 | 64.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-32BNumber of Parameters=32B, Prompting Strategy=reproduced using our prompt2025.03 | 63.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Bespoke-32BModel Type=Open Weights and Open Data, Fine-tuning examples=17K2025.01 | 63.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-4BParameters=4B, Type=Baseline2026.02 | 63.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Lp-RegModel=Deepseek-R1-Distill-Qwen-7B2025.12 | 61.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VERL (async)NPUs=64, GBS=64, MBS=642025.11 | 61.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | 157.765 | 44.016 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| W-REINFORCEModel=Deepseek-R1-Distill-Qwen-7B2025.12 | 61.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DAPO w/ Fork TokensModel=Deepseek-R1-Distill-Qwen-7B2025.12 | 61.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DAPOModel=Deepseek-R1-Distill-Qwen-7B2025.12 | 60.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PROMPTCOT-DS-7BBase Model=DeepSeek-R1-Distill-Qwen-7B, Reasoning Strategy=long-CoT, Parameters=7B2025.03 | 60 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PROMPTCOT-DS-7BNumber of Parameters=7B2025.03 | 60 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini 2.0 Flash ThinkingModel Type=API only, Fine-tuning examples=N.A.2025.01 | 60 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-OSS 20Bcontext window=20,000 tokens2026.02 | 60 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPOModel=Deepseek-R1-Distill-Qwen-7B2025.12 | 59.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CATBackbone=DeepSeek-R1-Distill-Qwen-7B2026.07 | 58.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 9,880 | 5,401 | 23 | 29.2 | — | — | |
| SeerAttention-rToken Budget (K)=2000, Backbone=Qwen3-8B2025.08 | 58.2 | — | — | — | 19.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| S1-32BNumber of Parameters=32B2025.03 | 56.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| s1-32BModel Type=Open Weights and Open Data, Fine-tuning examples=1K, Budget Forcing=true2025.01 | 56.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DASTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.07 | 56.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 10,804 | 7,158 | 15.8 | 6.2 | — | — | |
| RA-RFTModel Scale=Qwen3-1.7B, Temperature=1.0, Maximum generation length=32,768, Sample count (k)=322026.06 | 55.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPIRALFamily=DeepSeek-Distill-Qwen-7B Family, Game=Multi-Game2025.06 | 54.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JETBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 54 | — | — | — | 7,981 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MURBackbone=Qwen3-30B-A3B, Search Strategy=Guided search2025.07 | 53.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 27,788 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DAPOBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 53.3 | — | — | — | 8,414 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TidalDecodeToken Budget (K)=2000, Backbone=Qwen3-8B2025.08 | 53.3 | — | — | — | 17.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| R1-7BBackbone=DeepSeek-R1-Distill-Qwen-7B2026.07 | 53.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 12,831 | 7,631 | — | — | — | — | |
| DeepSeek-Distill-Qwen-7BFamily=DeepSeek-Distill-Qwen-7B Family2025.06 | 53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DPOBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 53 | — | — | — | 9,552 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Laser-DEBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 53 | — | — | — | 5,809 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Laser-DBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 52.7 | — | — | — | 6,361 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InftyThink+Base Model=Qwen3-4B-Base, RL Setting=Task reward only2026.02 | 52.29 | — | 21.44 | 319.15 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OverThinkSimPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.07 | 52.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 10,030 | 5,845 | 21.8 | 23.4 | — | — | |
| QuestAModel Scale=Qwen3-1.7B, Temperature=1.0, Maximum generation length=32,768, Sample count (k)=322026.06 | 52 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RoT+TIModel=DLER-7B2025.09 | 51.85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,008.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RoTModel=DeepSeek-R1-Llama8B2025.09 | 51.85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 9,397.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OPSDModel Scale=Qwen3-1.7B, Temperature=1.0, Maximum generation length=32,768, Sample count (k)=162026.06 | 51.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaseBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 51.3 | — | — | — | 9,812 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InftyThink+Base Model=DeepSeek-R1-Distill-Qwen-1.5B, RL Setting=Task reward only2026.02 | 50.94 | — | 23.36 | 102.85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaThinkBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 50.7 | — | — | — | 8,131 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPOModel Scale=Qwen3-1.7B, Temperature=1.0, Maximum generation length=32,768, Sample count (k)=322026.06 | 50.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaBase Model=Qwen3-4B-Base, RL Setting=Task reward only2026.02 | 50.31 | — | 17.16 | 571.18 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QwQ-32BNumber of Parameters=32B2025.03 | 50 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QwQ-32BModel Type=Open Weights, Fine-tuning examples=N.A.2025.01 | 50 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| s1 w/o BFModel Type=Open Weights and Open Data, Fine-tuning examples=1K, Budget Forcing=false2025.01 | 50 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LCR1Backbone=DeepSeek-Distill-Qwen-7B2025.09 | 50 | — | — | — | 6,329 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QuestToken Budget (K)=6000, Backbone=Qwen3-8B2025.08 | 49.6 | — | — | — | 19.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InftyThink+Base Model=Qwen3-4B-Base, RL Setting=Task + efficiency reward used2026.02 | 49.06 | — | 13.46 | 185.79 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConCISESimPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.07 | 48.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 8,854 | 5,333 | 31 | 30.1 | — | — | |
| SFTBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 48.7 | — | — | — | 9,814 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Base (Instruct)Model Scale=Qwen3-1.7B, Temperature=1.0, Maximum generation length=32,768, Sample count (k)=322026.06 | 48.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FullKVBackbone=DeepSeek-R1-Distill-Qwen-7B, KV budget=100%2026.04 | 46.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TriAttentionBackbone=DeepSeek-R1-Distill-Qwen-7B, KV budget=30%2026.04 | 46.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QuestToken Budget (K)=4000, Backbone=Qwen3-8B2025.08 | 46.7 | — | — | — | 22.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |