Code Reasoning on LiveCodeBench
87.4AccuracyGemini-3.0
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Gemini-3.0version=Pro2026.02 | 87.4 | — | — | — | 13,000 | — | — | |
| Kimi K2.52026.02 | 85 | — | — | — | 18,000 | — | — | |
| DeepSeek-V3.2mode=Thinking2026.02 | 83.3 | — | — | — | 16,000 | — | — | |
| Kimi K2mode=Thinking2026.02 | 82.6 | — | — | — | 25,000 | — | — | |
| GSPO + IBPO(mask)Model=Qwen3-32B2026.04 | 76 | — | — | — | — | — | — | |
| GSPO + IBPO(mask)Model=Qwen3-Next2026.04 | 75.8 | — | — | — | — | — | — | |
| GSPO + IBPOModel=Qwen3-32B2026.04 | 75.3 | — | — | — | — | — | — | |
| GSPO + IBPOModel=Qwen3-Next2026.04 | 75.3 | — | — | — | — | — | — | |
| ASAGModel=Qwen3-32B2026.06 | 75.3 | 4,745 | — | — | — | 63.1 | — | |
| GSPO + IBPO(ratio)Model=Qwen3-32B2026.04 | 74.9 | — | — | — | — | — | — | |
| ASAGModel=Qwen3-14B2026.06 | 74.8 | 4,926 | — | — | — | 60.7 | — | |
| GSPO + IBPO(ratio)Model=Qwen3-Next2026.04 | 74.7 | — | — | — | — | — | — | |
| VanillaModel=Qwen3-32B2026.06 | 74.1 | 7,521 | — | — | — | 100 | — | |
| VanillaModel=Qwen3-14B2026.06 | 72.6 | 8,112 | — | — | — | 100 | — | |
| GSPO with SCoReModel=Qwen3-Next2026.04 | 71.9 | — | — | — | — | — | — | |
| GSPO with Best-of-NModel=Qwen3-Next, N=82026.04 | 71.6 | — | — | — | — | — | — | |
| GSPO with promptModel=Qwen3-Next2026.04 | 71.4 | — | — | — | — | — | — | |
| GSPOModel=Qwen3-Next2026.04 | 70.9 | — | — | — | — | — | — | |
| GSPO with Best-of-NModel=Qwen3-32B, N=82026.04 | 66.1 | — | — | — | — | — | — | |
| ASAGModel=Qwen3-8B2026.06 | 66.1 | 4,561 | — | — | — | 51.1 | — | |
| ASAGModel=Qwen3-4B2026.06 | 65.4 | 5,369 | — | — | — | 61.7 | — | |
| GSPO with promptModel=Qwen3-32B2026.04 | 65.3 | — | — | — | — | — | — | |
| GSPO with SCoReModel=Qwen3-32B2026.04 | 65.2 | — | — | — | — | — | — | |
| VanillaModel=Qwen3-8B2026.06 | 64.7 | 8,923 | — | — | — | 100 | — | |
| GSPOModel=Qwen3-32B2026.04 | 64.6 | — | — | — | — | — | — | |
| VanillaModel=Qwen3-4B2026.06 | 64.2 | 8,705 | — | — | — | 100 | — | |
| Qwen3-8B-Thinking†Model Type=Autoregressive2026.02 | 59.5 | — | — | 1 | — | — | — | |
| TableLongBase Model=DS-R1-Distill-32B, RL-finetuned=true2026.03 | 58.68 | — | — | — | — | — | — | |
| TLMREModel Size=7B2026.02 | 53.5 | 3,988 | 0.8 | — | — | — | — | |
| ATTNPOModel Size=7B2026.02 | 52.3 | 2,873 | 0.85 | — | — | — | — | |
| DS-7BModel Size=7B2026.02 | 49.6 | 9,095 | 0 | — | — | — | — | |
| BF16 BaselineModel=Qwen3-4B, W-Bits=BF162026.01 | 48.38 | — | — | — | — | 70.63 | — | |
| DS-R1-Distill-32BModel=DS-R1-Distill-32B2026.03 | 46.71 | — | — | — | — | — | — | |
| TableLongBase Model=DS-R1-Distill-14B, RL-finetuned=true2026.03 | 45.51 | — | — | — | — | — | — | |
| ASAGModel=DeepSeek-R1-Distill-Llama-8B2026.06 | 43.8 | 3,314 | — | — | — | 30 | — | |
| DS-R1-Distill-14BModel=DS-R1-Distill-14B2026.03 | 43.71 | — | — | — | — | — | — | |
| TDAR-8B-thinking + BACD + TCCFModel Type=Block Diffusion, Block Size (B)=16, Decoding=BACD + TCCF2026.02 | 42.6 | — | — | 1.32 | — | — | — | |
| VanillaModel=DeepSeek-R1-Distill-Llama-8B2026.06 | 41.5 | 11,029 | — | — | — | 100 | — | |
| TDAR-8B-thinkingModel Type=Block Diffusion, Block Size (B)=162026.02 | 40.5 | — | — | 1.25 | — | — | — | |
| ASAGModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 40.3 | 2,945 | — | — | — | 28 | — | |
| TDAR-8B-thinking + BACDModel Type=Block Diffusion, Block Size (B)=16, Decoding=BACD2026.02 | 40.1 | — | — | 1.46 | — | — | — | |
| VanillaModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 38.4 | 10,516 | — | — | — | 100 | — | |
| Reasoning-QATModel=Qwen3-4B, W-Bits=W4A4KV42026.01 | 34.95 | — | — | — | — | 60.78 | -9.85 | |
| PIRBackbone=QwQ-32B2026.02 | 34.62 | — | — | — | 5,587.4 | — | — | |
| PIRBackbone=DeepSeek-R1-32B2026.02 | 34.62 | — | — | — | 4,834.88 | — | — | |
| Surrogate-TraceStudent Model=Qwen, Surrogate=R1, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 33.2 | — | — | — | — | — | — | |
| QwQ-32BBackbone=QwQ-32B2026.02 | 30.77 | — | — | — | 6,723.94 | — | — | |
| DeepSeek-R1-32BBackbone=DeepSeek-R1-32B2026.02 | 30.77 | — | — | — | 6,103.94 | — | — | |
| ATTNPOModel Size=1.5B2026.02 | 30.4 | 7,567 | 0.9 | — | — | — | — | |
| FlatQuantModel=Qwen3-4B, W-Bits=W4A4KV42026.01 | 29.1 | — | — | — | — | 58.28 | -12.35 | |
| Synthesized-TraceStudent Model=Qwen, Surrogate=R1, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 28.9 | — | — | — | — | — | — | |
| TLMREModel Size=1.5B2026.02 | 28.6 | 9,077 | 0.55 | — | — | — | — | |
| Synthesized-TraceStudent Model=Qwen, Surrogate=R1-Distill, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 25.6 | — | — | — | — | — | — | |
| DS-1.5BModel Size=1.5B2026.02 | 25.3 | 10,809 | 0 | — | — | — | — | |
| PIRBackbone=DeepSeek-R1-14B2026.02 | 25 | — | — | — | 5,117.71 | — | — | |
| TraDo-8B-Thinking + BACDModel Type=Block Diffusion, Block Size (B)=4, Decoding=BACD2026.02 | 23.3 | — | — | 1.15 | — | — | — | |
| Surrogate-TraceStudent Model=Qwen, Surrogate=R1-Distill, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 22.9 | — | — | — | — | — | — | |
| TraDo-8B-ThinkingModel Type=Block Diffusion, Block Size (B)=42026.02 | 22.6 | — | — | 1.1 | — | — | — | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 21.99 | 5,912 | — | — | — | — | — | |
| TraDo-8B-Thinking + BACD + TCCFModel Type=Block Diffusion, Block Size (B)=4, Decoding=BACD + TCCF2026.02 | 21.9 | — | — | 1.11 | — | — | — | |
| DeepSeek-R1-14BBackbone=DeepSeek-R1-14B2026.02 | 21.15 | — | — | — | 6,433.59 | — | — | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 21.04 | 5,153 | — | — | — | — | — | |
| ExpThinkBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 20.73 | 4,538 | — | — | — | — | — | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 20.28 | 5,980 | — | — | — | — | — | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 20.19 | 6,156 | — | — | — | — | — | |
| PIRBackbone=DeepSeek-R1-7B2026.02 | 19.25 | — | — | — | 6,568.69 | — | — | |
| VanillaBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 19.15 | 6,509 | — | — | — | — | — | |
| Answer-onlyStudent Model=Qwen, Surrogate=None, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 17.5 | — | — | — | — | — | — | |
| ReProBackbone=Qwen3-4B-Base, Sample Count=Avg@4, Evaluation Domain=Out-of-domain, Base Method=GRPO2025.12 | 17.3 | — | — | — | — | — | — | |
| LC-R1Backbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 16.11 | 5,123 | — | — | — | — | — | |
| BF16 BaselineModel=R1-1.5B, W-Bits=BF162026.01 | 16.04 | — | — | — | — | 48.72 | — | |
| OriginalBackbone=Qwen3-4B-Base, Sample Count=Avg@4, Evaluation Domain=Out-of-domain2025.12 | 15.9 | — | — | — | — | — | — | |
| DeepSeek-R1-7BBackbone=DeepSeek-R1-7B2026.02 | 15.38 | — | — | — | 7,055.57 | — | — | |
| GRPOBackbone=Qwen3-4B-Base, Sample Count=Avg@4, Evaluation Domain=Out-of-domain2025.12 | 15.3 | — | — | — | — | — | — | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 13.93 | 6,389 | — | — | — | — | — | |
| ExpThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 13.65 | 4,626 | — | — | — | — | — | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 13.55 | 6,355 | — | — | — | — | — | |
| BF16 BaselineModel=Qwen3-0.6B, W-Bits=BF162026.01 | 12.94 | — | — | — | — | 41.1 | — | |
| LLaDA-MoEModel Type=Masked Diffusion2026.02 | 12.9 | — | — | 2.05 | — | — | — | |
| VanillaBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 12.8 | 6,218 | — | — | — | — | — | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 12.61 | 5,870 | — | — | — | — | — | |
| Answer+SummaryStudent Model=Qwen, Surrogate=None, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 12.4 | — | — | — | — | — | — | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 11.56 | 6,820 | — | — | — | — | — | |
| DiRL-8B-InstructModel Type=Block Diffusion, Block Size (B)=42026.02 | 10.4 | — | — | 2.64 | — | — | — | |
| Surrogate-TraceStudent Model=Llama, Surrogate=R1, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 10.4 | — | — | — | — | — | — | |
| Synthesized-TraceStudent Model=Llama, Surrogate=R1-Distill, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 10.2 | — | — | — | — | — | — | |
| Reasoning-QATModel=R1-1.5B, W-Bits=W4A4KV42026.01 | 10.07 | — | — | — | — | 41.31 | -7.41 | |
| LC-R1Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 9.48 | 3,217 | — | — | — | — | — | |
| Surrogate-TraceStudent Model=Llama, Surrogate=R1-Distill, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 9.1 | — | — | — | — | — | — | |
| SDAR-8B-ChatModel Type=Block Diffusion, Block Size (B)=42026.02 | 7.5 | — | — | 1.6 | — | — | — | |
| TraDo-8B-InstructModel Type=Block Diffusion, Block Size (B)=42026.02 | 7.2 | — | — | 1.42 | — | — | — | |
| Fast-dLLM-v2Model Type=Block Diffusion, Block Size (B)=322026.02 | 6.8 | — | — | 1.73 | — | — | — | |
| FlatQuantModel=R1-1.5B, W-Bits=W4A4KV42026.01 | 6.72 | — | — | — | — | 38.39 | -10.33 | |
| Synthesized-TraceStudent Model=Llama, Surrogate=R1, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 6.5 | — | — | — | — | — | — | |
| Answer-onlyStudent Model=Llama, Surrogate=None, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 6.3 | — | — | — | — | — | — | |
| LLaDAModel Type=Masked Diffusion2026.02 | 4.7 | — | — | 2.83 | — | — | — | |
| LLaDA-1.5Model Type=Masked Diffusion2026.02 | 4.3 | — | — | 2.86 | — | — | — | |
| FlatQuantModel=Qwen3-0.6B, W-Bits=W4A4KV42026.01 | 1.87 | — | — | — | — | 17.34 | -23.76 | |
| Reasoning-QATModel=Qwen3-0.6B, W-Bits=W4A4KV42026.01 | 1.37 | — | — | — | — | 21.44 | -19.66 | |
| Answer+SummaryStudent Model=Llama, Surrogate=None, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 0.4 | — | — | — | — | — | — |