Commonsense Reasoning on BoolQ (ACC, ECE, NLL)
87.6AccuracyBayesLoRA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BayesLoRAk=10, Params (M)=2.40–3.872025.06 | 87.6 | 6.87 | 0.38 | |
| BayesLoRAk=0, Params (M)=2.40–3.872025.06 | 87.54 | 9.73 | 0.49 | |
| BayesLoRAr=8, k=0, Params (M)=4.482025.06 | 87.42 | 10.11 | 0.5 | |
| MCDBackbone=Llama2-7B, Method=LoRA, Steps=5,0002024.06 | 87.29 | 3.46 | 0.31 | |
| MCDParams (M)=4.482025.06 | 87.29 | 3.46 | 0.31 | |
| BBBBackbone=Llama2-7B, Method=LoRA, Steps=5,0002024.06 | 87.21 | 3.74 | 0.31 | |
| BBBParams (M)=9.982025.06 | 87.21 | 3.74 | 0.31 | |
| BayesLoRAr=8, k=10, Params (M)=4.482025.06 | 87.14 | 7.34 | 0.38 | |
| ENSBackbone=Llama2-7B, Method=LoRA, Steps=5,0002024.06 | 87.09 | 9.61 | 0.57 | |
| ENSParams (M)=44.802025.06 | 87.09 | 9.61 | 0.57 | |
| BLoBBackbone=Llama2-7B, Method=LoRA, Steps=5,000, N=102024.06 | 86.99 | 1.41 | 0.31 | |
| BLoB (N=10)N (Ensemble Size)=10, rind=9, cind=92026.01 | 86.99 | 1.41 | 0.31 | |
| LAPBackbone=Llama2-7B, Method=LoRA, Steps=5,0002024.06 | 86.95 | 1.3 | 0.31 | |
| BLoBBackbone=Llama2-7B, Method=LoRA, Steps=5,000, N=02024.06 | 86.8 | 2.46 | 0.32 | |
| MLEBackbone=Llama2-7B, Method=LoRA, Steps=5,0002024.06 | 86.53 | 3.18 | 0.32 | |
| LoRAParams (M)=4.482025.06 | 86.53 | 3.18 | 0.32 | |
| MAPBackbone=Llama2-7B, Method=LoRA, Steps=5,0002024.06 | 86.5 | 3.16 | 0.33 | |
| BLoBBackbone=Llama2-7B, Method=LoRA, Steps=5,000, N=52024.06 | 86.47 | 1.63 | 0.32 | |
| Bayesian-LoRA (S=4)S (Samples)=4, Evaluation Protocol=End-to-End, rind=9, cind=92026.01 | 86.1 | 2.1 | 0.29 | |
| Dropoutrind=9, cind=92026.01 | 85.9 | 7.5 | 0.43 | |
| MAPrind=9, cind=92026.01 | 85.8 | 7.4 | 0.43 | |
| Temprind=9, cind=92026.01 | 85.8 | 2.5 | 0.35 | |
| LLLA (post-hoc)Evaluation Protocol=post-hoc, rind=9, cind=92026.01 | 85.8 | 1.7 | 0.35 | |
| LA (post-hoc)Evaluation Protocol=post-hoc, rind=9, cind=92026.01 | 85.8 | 1.9 | 0.34 | |
| Ckpt Ensrind=9, cind=92026.01 | 85.4 | 3.2 | 0.35 | |
| BBBrind=9, cind=92026.01 | 83.17 | 3.74 | 0.31 | |
| BaLoRAModel=Llama-3-8B, Params (%)=0.71452026.04 | 76.42 | — | — | |
| HiRAModel=Llama-3-8B, Params (%)=0.70022026.04 | 75.4 | — | — | |
| DoRAModel=Llama-3-8B, Params (%)=0.70022026.04 | 74.6 | — | — | |
| MoRAModel=Llama-3-8B, Params (%)=0.69972026.04 | 74.28 | — | — | |
| ChatGPTModel=ChatGPT2026.04 | 73.1 | — | — | |
| BaLoRAModel=Llama-2-7B, Params (%)=0.84272026.04 | 72.69 | — | — | |
| MoRAModel=Llama-2-7B, Params (%)=0.82412026.04 | 72.17 | — | — | |
| DoRAModel=Llama-2-7B, Params (%)=0.82562026.04 | 71.8 | — | — | |
| HiRAModel=Llama-2-7B, Params (%)=0.82562026.04 | 71.22 | — | — | |
| LoRAModel=Llama-3-8B, Params (%)=0.70022026.04 | 70.8 | — | — | |
| LoRAModel=Llama-2-7B, Params (%)=0.82562026.04 | 69.8 | — | — | |
| P-TuningModel=Llama-3-8B, Params (%)=0.62402026.04 | 59.97 | — | — | |
| P-TuningModel=Llama-2-7B, Params (%)=0.74282026.04 | 58.75 | — | — | |
| Prompt TuningModel=Llama-3-8B, Params (%)=0.00102026.04 | 56.85 | — | — | |
| Prompt TuningModel=Llama-2-7B, Params (%)=0.00122026.04 | 55.93 | — | — |