Commonsense Reasoning on ARC-E
96.56AccuracyBaRA
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| BaRAParams (M)=5.6082026.06 | 96.56 | 1.67 | 0.1 | — | — | — | — | — | |
| BLoBParams (M)=5.4032026.06 | 96.54 | 1.6 | 0.1 | — | — | — | — | — | |
| Self-consistencyModel=PaLM-540B2022.03 | 96.4 | — | — | — | — | — | — | — | |
| C-LoRAParams (M)=4.2752026.06 | 96.35 | 3.7 | 0.21 | — | — | — | — | — | |
| ScalaBLParams (M)=3.7692026.06 | 96.26 | 1.78 | 0.11 | — | — | — | — | — | |
| FVAE-LoRAParams (M)=33.532026.06 | 96.25 | 2.91 | 0.13 | — | — | — | — | — | |
| Self-consistencyModel=GPT-3 (Code-davinci-002)2022.03 | 96 | — | — | — | — | — | — | — | |
| MC-DropoutParams (M)=3.7682026.06 | 95.77 | 4.01 | 0.43 | — | — | — | — | — | |
| MAPParams (M)=3.7682026.06 | 95.73 | 4.08 | 0.43 | — | — | — | — | — | |
| EnsembleParams (M)=11.3052026.06 | 95.73 | 3.75 | 0.25 | — | — | — | — | — | |
| MLEParams (M)=3.7682026.06 | 95.6 | 4.17 | 0.44 | — | — | — | — | — | |
| LaplaceParams (M)=3.7682026.06 | 95.34 | 33.8 | 0.51 | — | — | — | — | — | |
| CoT-promptingModel=PaLM-540B2022.03 | 95.3 | — | — | — | — | — | — | — | |
| CoT-promptingModel=GPT-3 (Code-davinci-002)2022.03 | 94 | — | — | — | — | — | — | — | |
| TFBBackbone=Llama3.1-8B, Fine-tuning method=LoRA, Monte Carlo samples (M)=102026.07 | 91.9 | 3 | 0.25 | — | — | — | — | — | |
| ENSBackbone=Llama3.1-8B, Fine-tuning method=LoRA2026.07 | 91.84 | 6.59 | 0.38 | — | — | — | — | — | |
| MLEBackbone=Llama3.1-8B, Fine-tuning method=LoRA2026.07 | 91.67 | 7 | 0.46 | — | — | — | — | — | |
| MAPBackbone=Llama3.1-8B, Fine-tuning method=LoRA2026.07 | 91.61 | 6.62 | 0.46 | — | — | — | — | — | |
| PoLAR-VBLL (w/o LA)Backbone=Llama-3.1-8B, Fine-tuning steps=50002026.04 | 91.38 | 4.9 | 0.36 | — | — | — | — | — | |
| PoLAR-VBLLBackbone=Llama-3.1-8B, Fine-tuning steps=50002026.04 | 91.38 | 3.71 | 0.33 | — | — | — | — | — | |
| MCDBackbone=Llama3.1-8B, Fine-tuning method=LoRA, Monte Carlo samples (M)=102026.07 | 91.37 | 6.73 | 0.45 | — | — | — | — | — | |
| TFBBackbone=Llama-3.1-8B, Fine-tuning steps=50002026.04 | 91.2 | 3.72 | 0.33 | — | — | — | — | — | |
| PoLAR-BLoBBackbone=Llama-3.1-8B, Fine-tuning steps=50002026.04 | 91.19 | 5.76 | 0.35 | — | — | — | — | — | |
| TFB-LLBackbone=Llama-3.1-8B, Fine-tuning steps=50002026.04 | 91.03 | 3.77 | 0.35 | — | — | — | — | — | |
| DALorRABackbone=Llama3.1-8B, Fine-tuning method=LoRA, Monte Carlo samples (M)=102026.07 | 90.97 | 2.88 | 0.28 | — | — | — | — | — | |
| BLoBBackbone=Llama3.1-8B, Fine-tuning method=LoRA, Monte Carlo samples (M)=102026.07 | 90.83 | 4.24 | 0.3 | — | — | — | — | — | |
| C-LoRABackbone=Llama3.1-8B, Fine-tuning method=LoRA, Monte Carlo samples (M)=102026.07 | 90.79 | 4.95 | 0.33 | — | — | — | — | — | |
| LABackbone=Llama3.1-8B, Fine-tuning method=LoRA2026.07 | 90.73 | 5.27 | 1.04 | — | — | — | — | — | |
| MLEBackbone=Llama-3.1-8B, Fine-tuning steps=50002026.04 | 90.66 | 8.95 | 0.74 | — | — | — | — | — | |
| LABackbone=Llama-3.1-8B, Fine-tuning steps=50002026.04 | 90.66 | 4.51 | 0.61 | — | — | — | — | — | |
| C-LoRABackbone=Llama-3.1-8B, Fine-tuning steps=50002026.04 | 90.4 | 5.42 | 0.35 | — | — | — | — | — | |
| PoLAR-MLEBackbone=Llama-3.1-8B, Fine-tuning steps=50002026.04 | 90.25 | 9.02 | 0.79 | — | — | — | — | — | |
| PoLAR-LABackbone=Llama-3.1-8B, Fine-tuning steps=50002026.04 | 90.25 | 6.15 | 0.39 | — | — | — | — | — | |
| PoLAR-LA-LLBackbone=Llama-3.1-8B, Fine-tuning steps=50002026.04 | 90.25 | 5.41 | 0.36 | — | — | — | — | — | |
| BLoBBackbone=Llama-3.1-8B, Fine-tuning steps=50002026.04 | 90.16 | 5.66 | 0.3 | — | — | — | — | — | |
| FFTModel=Llama-3.2-3B, #Params=3.21B2025.09 | 90 | — | — | — | — | — | — | — | |
| ABBAModel=Llama-3.2-3B, #Params=48.63M2025.09 | 89.66 | — | — | — | — | — | — | — | |
| BoHAModel=Llama-3.2-3B, #Params=48.63M2025.09 | 89.62 | — | — | — | — | — | — | — | |
| HiRAModel=Llama-3.2-3B, #Params=48.63M2025.09 | 89.53 | — | — | — | — | — | — | — | |
| EnsembleBackbone=Llama3.1-8B2024.10 | 89.141 | 7.08 | — | — | — | — | — | — | |
| GraLoRAModel=Llama-3.2-3B, #Params=48.63M2025.09 | 88.9 | — | — | — | — | — | — | — | |
| LoRABackbone=Llama3.1-8B2024.10 | 88.821 | 6.551 | — | — | — | — | — | — | |
| BLoB(Mean)Backbone=Llama3.1-8B, Variant=Mean2024.10 | 88.71 | 4.89 | — | — | — | — | — | — | |
| UQ4CTBackbone=Llama3.1-8B2024.10 | 88.66 | 3.97 | — | — | — | — | — | — | |
| MC DropBackbone=Llama3.1-8B2024.10 | 88.161 | 6.481 | — | — | — | — | — | — | |
| DoRAModel=Llama-3.2-3B, #Params=49.40M2025.09 | 88.09 | — | — | — | — | — | — | — | |
| BLoB(N=10)Backbone=Llama3.1-8B, N=102024.10 | 87.96 | 3.35 | — | — | — | — | — | — | |
| MixLoRABackbone=Llama3.1-8B2024.10 | 87.74 | 7.79 | — | — | — | — | — | — | |
| LoRAModel=Llama-3.2-3B, #Params=48.63M2025.09 | 87.54 | — | — | — | — | — | — | — | |
| Base ModelBackbone=Llama3.1-8B2024.10 | 87.27 | 13.76 | — | — | — | — | — | — | |
| PiSSAModel=Llama-3.2-3B, #Params=48.63M2025.09 | 86.77 | — | — | — | — | — | — | — | |
| rsLoRAModel=Llama-3.2-3B, #Params=48.63M2025.09 | 86.71 | — | — | — | — | — | — | — | |
| BLoBBackbone=Llama2-7B, Method=LoRA, Steps=5,000, N=02024.06 | 86.68 | 9.43 | 0.56 | — | — | — | — | — | |
| MAPBackbone=Llama2-7B, Method=LoRA, Steps=5,0002024.06 | 86.55 | 12.07 | 0.9 | — | — | — | — | — | |
| Previous SoTA2022.03 | 86.4 | — | — | — | — | — | — | — | |
| L-LoRA-SParameters=10M, Phase=MAP2026.05 | 86.4 | 11.8 | 0.76 | — | — | — | — | — | |
| LABackbone=Llama3.1-8B2024.10 | 86.223 | 7.631 | — | — | — | — | — | — | |
| MCDBackbone=Llama2-7B, Method=LoRA, Steps=5,0002024.06 | 86.21 | 12.2 | 1 | — | — | — | — | — | |
| Ministral3-8BGen. Mode=AR, Avg TPF=1.002026.07 | 86.15 | — | — | — | — | — | — | — | |
| Bayesian-LoRA (S=4)S (Samples)=4, Evaluation Protocol=End-to-End, rind=9, cind=92026.01 | 85.91 | 5.3 | 0.38 | — | — | — | — | — | |
| L-LoRA-SParameters=10M, Phase=Bayesian2026.05 | 85.9 | 4.6 | 0.46 | — | — | — | — | — | |
| BBBBackbone=Llama2-7B, Method=LoRA, Steps=5,0002024.06 | 85.86 | 12.28 | 0.91 | — | — | — | — | — | |
| MLEBackbone=Llama2-7B, Method=LoRA, Steps=5,0002024.06 | 85.65 | 13.12 | 1.17 | — | — | — | — | — | |
| BLoBBackbone=Llama2-7B, Method=LoRA, Steps=5,000, N=102024.06 | 85.56 | 3.64 | 0.4 | — | — | — | — | — | |
| BLoB (N=10)N (Ensemble Size)=10, rind=9, cind=92026.01 | 85.56 | 3.64 | 0.4 | — | — | — | — | — | |
| LA (post-hoc)Evaluation Protocol=post-hoc, rind=9, cind=92026.01 | 85.4 | 3.4 | 0.41 | — | — | — | — | — | |
| MAPrind=9, cind=92026.01 | 85.2 | 8.9 | 0.54 | — | — | — | — | — | |
| Ckpt Ensrind=9, cind=92026.01 | 85.2 | 8.9 | 0.54 | — | — | — | — | — | |
| Temprind=9, cind=92026.01 | 85.2 | 4.7 | 0.43 | — | — | — | — | — | |
| Dropoutrind=9, cind=92026.01 | 85.1 | 8.8 | 0.52 | — | — | — | — | — | |
| Laplace (LA)Phase=Bayesian2026.05 | 85.1 | 5.4 | 0.49 | — | — | — | — | — | |
| RFID-MoEBackbone=Qwen3-30B-A3B-2507, Ratio=20%, Evaluation Protocol=Zero-shot2026.02 | 85 | — | — | — | — | — | — | — | |
| WINO+Backbone=LLaDA-8B-Instruct, Shot=0-shot2026.05 | 84.97 | — | — | 24.86 | 10.3 | 178.75 | 10.36 | — | |
| Qwen3-235B-A22B#Bits=W16A16, Regime=PTQ, Zero-shot=true, Architecture=MoE2026.06 | 84.89 | — | — | — | — | — | — | — | |
| LLLA (post-hoc)Evaluation Protocol=post-hoc, rind=9, cind=92026.01 | 84.8 | 4.2 | 0.44 | — | — | — | — | — | |
| BLoBBackbone=Llama2-7B, Method=LoRA, Steps=5,000, N=52024.06 | 84.74 | 6.16 | 0.46 | — | — | — | — | — | |
| Laplace (LA)Phase=MAP2026.05 | 84.7 | 13.4 | 1.26 | — | — | — | — | — | |
| L-LoRA-SParameters=4M, Phase=Bayesian2026.05 | 84.5 | 4.6 | 0.49 | — | — | — | — | — | |
| ENSBackbone=Llama2-7B, Method=LoRA, Steps=5,0002024.06 | 84.4 | 12.57 | 0.82 | — | — | — | — | — | |
| L-LoRA-SParameters=4M, Phase=MAP2026.05 | 84.3 | 12.4 | 0.76 | — | — | — | — | — | |
| L-LoRA-XSRank=100, Phase=MAP2026.05 | 84 | 12.3 | 0.79 | — | — | — | — | — | |
| L-LoRA-XSRank=100, Phase=Bayesian2026.05 | 84 | 7.9 | 0.51 | — | — | — | — | — | |
| B-LoRA-XSRank=64, Phase=Bayesian2026.05 | 83.4 | 5.1 | 0.6 | — | — | — | — | — | |
| Nemotron-Labs-Diffusion-8BGen. Mode=AR, Avg TPF=1.002026.07 | 83.38 | — | — | — | — | — | — | — | |
| Nemotron-Labs-Diffusion-8BGen. Mode=Diff., Avg TPF=2.062026.07 | 83.38 | — | — | — | — | — | — | — | |
| Nemotron-Labs-Diffusion-8BGen. Mode=Linear SS, Avg TPF=4.672026.07 | 83.38 | — | — | — | — | — | — | — | |
| Nemotron-Labs-Diffusion-8BGen. Mode=Quad. SS, Avg TPF=7.042026.07 | 83.38 | — | — | — | — | — | — | — | |
| L-LoRA-XSRank=64, Phase=MAP2026.05 | 83.2 | 10.6 | 0.67 | — | — | — | — | — | |
| Qwen3-32B#Bits=W16A16, Regime=PTQ, Zero-shot=true, Architecture=Dense2026.06 | 83.12 | — | — | — | — | — | — | — | |
| L-LoRA-XSRank=32, Phase=MAP2026.05 | 82.9 | 9.2 | 0.6 | — | — | — | — | — | |
| B-LoRA-XSRank=64, Phase=MAP2026.05 | 82.9 | 14.1 | 0.97 | — | — | — | — | — | |
| Qwen3-14B#Bits=W16A16, Regime=PTQ, Zero-shot=true, Architecture=Dense2026.06 | 82.83 | — | — | — | — | — | — | — | |
| L-LoRA-XSRank=64, Phase=Bayesian2026.05 | 82.7 | 8.5 | 0.53 | — | — | — | — | — | |
| L-LoRA-XSRank=32, Phase=Bayesian2026.05 | 82.7 | 6.6 | 0.52 | — | — | — | — | — | |
| B-LoRA-XSRank=32, Phase=Bayesian2026.05 | 82.4 | 6.3 | 0.61 | — | — | — | — | — | |
| B-LoRA-XSRank=32, Phase=MAP2026.05 | 82.2 | 12.8 | 0.89 | — | — | — | — | — | |
| Dream-7BGen. Mode=Diff., Avg TPF=1.002026.07 | 82.2 | — | — | — | — | — | — | — | |
| RF2-100B-A6.1B#Bits=W16A16, Regime=PTQ, Zero-shot=true, Architecture=MoE2026.06 | 81.99 | — | — | — | — | — | — | — | |
| MetaTT-4DBackbone=Llama-2-13b, Rank=64, Param × 10⁵=8.3, Protocol=Fine-tuning2025.06 | 81.9 | — | — | — | — | — | — | — | |
| Qwen3-8BGen. Mode=AR, Avg TPF=1.002026.07 | 81.9 | — | — | — | — | — | — | — |