Reasoning on PIQA
96.5AccuracyLLaDA2.0-flash
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LLaDA2.0-flash2026.02 | 96.5 | — | 1.43 | — | |
| LLaDA2.1-flashInference Mode=S Mode2026.02 | 92.44 | — | 2.38 | — | |
| LLaDA2.1-flashInference Mode=Q Mode2026.02 | 92.17 | — | 1.44 | — | |
| Ling-flash-2.02026.02 | 91.95 | — | 1 | — | |
| Qwen3-30B-A3B-Inst-25072026.02 | 91.57 | — | 1 | — | |
| Flexora (w/ LoReFT)Backbone Model=Llama3-8B, LoRA Algorithm=LoReFT, Flexora Integration=true2024.08 | 91.06 | — | — | — | |
| LoReFTBackbone Model=Llama3-8B, LoRA Algorithm=LoReFT, Flexora Integration=false2024.08 | 90.24 | — | — | — | |
| Flexora (w/ rsLoRA)Backbone Model=Llama3-8B, LoRA Algorithm=rsLoRA, Flexora Integration=true2024.08 | 87.58 | — | — | — | |
| rsLoRABackbone Model=Llama3-8B, LoRA Algorithm=rsLoRA, Flexora Integration=false2024.08 | 87.21 | — | — | — | |
| Flexora (w/ MoSLoRA)Backbone Model=Llama3-8B, LoRA Algorithm=MoSLoRA, Flexora Integration=true2024.08 | 86.43 | — | — | — | |
| Shakti-LLMParameters=2.5B, Shots=5-shot2024.10 | 86.2 | — | — | — | |
| Flexora (w/ DoRA)Backbone Model=Llama3-8B, LoRA Algorithm=DoRA, Flexora Integration=true2024.08 | 86.05 | — | — | — | |
| Mistral 8x7BParameters=8x7B, Shots=5-shot2024.10 | 86 | — | — | — | |
| MoSLoRABackbone Model=Llama3-8B, LoRA Algorithm=MoSLoRA, Flexora Integration=false2024.08 | 85.97 | — | — | — | |
| Flexora (w/ LoRA)Backbone Model=Llama3-8B, LoRA Algorithm=LoRA, Flexora Integration=true2024.08 | 85.91 | — | — | — | |
| FlexoraFine-tuning Strategy=LoRA, Enhanced=Flexora2024.08 | 85.91 | — | — | — | |
| Flexora(w/ Base Model)Backbone=Meta-Llama-3-8B, Model variant=Base, Adaptation=Flexora2024.08 | 85.91 | — | — | — | |
| Flexora(w/ Instruct Model)Backbone=Meta-Llama-3-8B-Instruct, Model variant=Instruct, Adaptation=Flexora2024.08 | 85.76 | — | — | — | |
| DoRABackbone Model=Llama3-8B, LoRA Algorithm=DoRA, Flexora Integration=false2024.08 | 85.75 | — | — | — | |
| JT-Safe-V2-35BParameters=35B2026.05 | 84.22 | — | — | — | |
| Phi-3 Mini-4kShots=5-shot2024.10 | 84.2 | — | — | — | |
| FlexoraFine-tuning Strategy=Full Fine-Tuning, Enhanced=Flexora2024.08 | 83.21 | — | — | — | |
| Original (T2T)Backbone=LLaDA2.1-mini, Inference Strategy=Text-to-Text2026.04 | 82.37 | — | — | — | |
| T2MBackbone=LLaDA2.1-mini, Inference Strategy=Token-to-Mask, Remasking Strategy=LOWPROB, τ=0.3, Cmax=1, ρmax=0.252026.04 | 81.94 | — | — | — | |
| FP16Model=Qwen2.5-14B2026.03 | 81.07 | — | — | — | |
| LLAMA-3-8BModel=LLAMA-3-8B, Bits=FP16, Zero-shot=true2026.04 | 80.96 | — | — | — | |
| GenKnowSubBase Model=Phi-2, Setting=Avg, Evaluation Protocol=zero-shot2025.05 | 80.47 | — | — | — | |
| Instruct ModelBackbone=Meta-Llama-3-8B-Instruct, Model variant=Instruct2024.08 | 80.36 | — | — | — | |
| GenKnowSubSetting=De, Zero-shot=true, Base Model=Phi-32025.05 | 80.3 | — | — | — | |
| ArrowZero-shot=true, Base Model=Phi-32025.05 | 80.2 | — | — | — | |
| GenKnowSubSetting=En, Zero-shot=true, Base Model=Phi-32025.05 | 80.2 | — | — | — | |
| GenKnowSubSetting=Avg, Zero-shot=true, Base Model=Phi-32025.05 | 80.03 | — | — | — | |
| SharedZero-shot=true, Base Model=Phi-32025.05 | 80 | — | — | — | |
| OLMo 2Parameters=7B, Shots=102026.01 | 80 | — | — | — | |
| GenKnowSubBase Model=Phi-2, Setting=En, Evaluation Protocol=zero-shot2025.05 | 79.97 | — | — | — | |
| Llama-3-8BBackbone=Llama-3-8B, #Bit=16.00, Zero-shot=true2025.03 | 79.9 | — | — | — | |
| DenseLLM=Llama2-13B, Ratio=0.00%2024.03 | 79.71 | — | — | — | |
| ArrowBase Model=Phi-2, Evaluation Protocol=zero-shot2025.05 | 79.65 | — | — | — | |
| Full FTFine-tuning Strategy=Full Fine-Tuning2024.08 | 79.32 | — | — | — | |
| AWQBackbone=Llama-3-8B, #Bit=4.13, Zero-shot=true2025.03 | 79.1 | — | — | — | |
| ClusCompBackbone=Llama-3-8B, #Bit=4.13, Zero-shot=true2025.03 | 79.1 | 80.5 | — | — | |
| FP16Model=Llama-2-13B2026.03 | 79.05 | — | — | — | |
| Phi-2Base Model=Phi-2, Evaluation Protocol=zero-shot2025.05 | 78.99 | — | — | — | |
| SliM-LLMBackbone=Llama-3-8B, #Bit=4.13, Zero-shot=true2025.03 | 78.9 | — | — | — | |
| GenKnowSubSetting=Fr, Zero-shot=true, Base Model=Phi-32025.05 | 78.78 | — | — | — | |
| GPTQBackbone=Llama-3-8B, #Bit=4.13, Zero-shot=true2025.03 | 78.4 | — | — | — | |
| Phi-3Zero-shot=true, Base Model=Phi-32025.05 | 78.24 | — | — | — | |
| Gemma 7BParameters=7B, Shots=5-shot2024.10 | 78.1 | — | — | — | |
| BaseBackbone=LLaMA-2-7B, Compression Ratio=0%2025.10 | 78.07 | — | — | — | |
| Mean NormZero-shot=true, Base Model=Phi-32025.05 | 78.02 | — | — | — | |
| BaselineCompression Ratio=0.02026.05 | 78 | — | — | — | |
| SAES-SVD + PARSECompression Ratio=0.22026.05 | 78 | — | — | — | |
| DenseLLM=Llama2-7B, Ratio=0.00%2024.03 | 77.91 | — | — | — | |
| SliM-LLMBackbone=Llama-3-8B, #Bit=3.13, Zero-shot=true2025.03 | 77.8 | — | — | — | |
| Mistral 7BParameters=7B, Shots=5-shot2024.10 | 77.7 | — | — | — | |
| AWQBackbone=Llama-3-8B, #Bit=3.13, Zero-shot=true2025.03 | 77.7 | — | — | — | |
| ClusCompBackbone=Llama-3-8B, #Bit=2.87, Zero-shot=true2025.03 | 77.7 | 78.8 | — | — | |
| SmolLM 2Params.=1.7B, Tokens=11T2025.06 | 77.6 | — | — | — | |
| LLAMA-1-7BModel=LLAMA-1-7B, Bits=FP16, Zero-shot=true2026.04 | 77.37 | — | — | — | |
| LLAMA-2-7BModel=LLAMA-2-7B, Bits=FP16, Zero-shot=true2026.04 | 76.93 | — | — | — | |
| Stable LM 2Params.=1.6B, Tokens=2T2025.06 | 76.8 | — | — | — | |
| QuIPBackbone=Llama-3-8B, #Bit=3.00, Zero-shot=true2025.03 | 76.8 | — | — | — | |
| NSDSModel=Llama-2-13B2026.03 | 76.78 | — | — | — | |
| NSDSModel=Qwen2.5-14B2026.03 | 76.78 | — | — | — | |
| LLMPrun.LLM=Llama2-13B, Ratio=24.4%2024.03 | 76.66 | — | — | — | |
| RTNBackbone=Llama-3-8B, #Bit=4.13, Zero-shot=true2025.03 | 76.6 | — | — | — | |
| LoRABackbone Model=Llama3-8B, LoRA Algorithm=LoRA, Flexora Integration=false2024.08 | 76.39 | — | — | — | |
| LoRAFine-tuning Strategy=LoRA2024.08 | 76.39 | — | — | — | |
| ZDModel=Qwen2.5-14B2026.03 | 76.32 | — | — | — | |
| DenseLLM=Baichuan2-7B, Ratio=0.00%2024.03 | 76.17 | — | — | — | |
| AdamParams.=1.4B, Tokens=1T2025.06 | 76.1 | — | — | — | |
| SmolLMParams.=1.7B, Tokens=1T2025.06 | 76 | — | — | — | |
| OLMo 3Parameters=7B, Shots=102026.01 | 76 | — | — | — | |
| KurtBoostModel=Llama-2-13B2026.03 | 75.97 | — | — | — | |
| LLM-PrunerBackbone=LLaMA-2-7B, Compression Ratio=20%2025.10 | 75.95 | — | — | — | |
| Self-Improving PretrainingTraining Dataset=SlimPajama, Pretraining Objective=Quality2026.01 | 75.8 | — | — | — | |
| Llama 3 8BParameters=8B, Shots=5-shot2024.10 | 75.7 | — | — | — | |
| Qwen 2.5Params.=1.5B2025.06 | 75.7 | — | — | — | |
| Self-Improving PretrainingTraining Dataset=RedPajama, Pretraining Objective=Safety2026.01 | 75.6 | — | — | — | |
| Muon (OSP)Params.=1.4B, Tokens=1T2025.06 | 75.5 | — | — | — | |
| KurtosisModel=Qwen2.5-14B2026.03 | 75.49 | — | — | — | |
| Qwen 2Params.=1.5B, Tokens=7T2025.06 | 75.4 | — | — | — | |
| EWQModel=Llama-2-13B2026.03 | 75.38 | — | — | — | |
| OLMoParams.=1.2B, Tokens=3T2025.06 | 75.2 | — | — | — | |
| Self-Improving PretrainingTraining Dataset=SlimPajama, Pretraining Objective=Factuality2026.01 | 75.1 | — | — | — | |
| SVD-LLM V2Compression Ratio=0.22026.05 | 75 | — | — | — | |
| LLAMA 3.2Params.=1.2B2025.06 | 74.9 | — | — | — | |
| GPTQBackbone=Llama-3-8B, #Bit=3.13, Zero-shot=true2025.03 | 74.9 | — | — | — | |
| ZDModel=Llama-2-13B2026.03 | 74.83 | — | — | — | |
| MSEModel=Qwen2.5-14B2026.03 | 74.81 | — | — | — | |
| Llama BaseTraining Dataset=Original Llama Pretraining, Pretraining Objective=Standard next token prediction2026.01 | 74.8 | — | — | — | |
| Qwen 1.5Params.=1.8B, Tokens=2.4T2025.06 | 74.3 | — | — | — | |
| Llama Pretrain BaselineTraining Dataset=RedPajama, Pretraining Objective=Safety2026.01 | 74.3 | — | — | — | |
| Llama Pretrain BaselineTraining Dataset=SlimPajama, Pretraining Objective=Standard next token prediction2026.01 | 74.2 | — | — | — | |
| EWQModel=Qwen2.5-14B2026.03 | 73.95 | — | — | — | |
| Krause-Qwen1.5-7BWindow size=32, top-k=162026.02 | 73.7 | — | — | — | |
| ShortGPTLLM=Llama2-13B, Ratio=24.6%2024.03 | 73.45 | — | — | — | |
| Krause-Qwen1.5-7BWindow size=48, top-k=242026.02 | 73.42 | — | — | — | |
| MSEModel=Llama-2-13B2026.03 | 73.35 | — | — | — | |
| MobileLLAMAParams.=1.4B, Tokens=1.3T2025.06 | 73.3 | — | — | — |