Common-sense Reasoning on ARC-E (OOD Small Shift)
87.27AccuracyMCD
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MCDBackbone=Llama3.1-8B, Fine-tuning method=LoRA, Evaluation protocol=OBQA->ARC-E, Monte Carlo samples (M)=102026.07 | 87.27 | 9.27 | 0.61 | |
| LABackbone=Llama3.1-8B, Fine-tuning method=LoRA, Evaluation protocol=OBQA->ARC-E2026.07 | 87.21 | 7.8 | 1.11 | |
| MLEBackbone=Llama3.1-8B, Fine-tuning method=LoRA, Evaluation protocol=OBQA->ARC-E2026.07 | 86.83 | 10.78 | 0.72 | |
| TFBBackbone=Llama3.1-8B, Fine-tuning method=LoRA, Evaluation protocol=OBQA->ARC-E, Monte Carlo samples (M)=102026.07 | 86.81 | 4.85 | 0.44 | |
| BLoBBackbone=Llama3.1-8B, Fine-tuning method=LoRA, Evaluation protocol=OBQA->ARC-E, Monte Carlo samples (M)=102026.07 | 86.63 | 5.12 | 0.46 | |
| MAPBackbone=Llama3.1-8B, Fine-tuning method=LoRA, Evaluation protocol=OBQA->ARC-E2026.07 | 86.58 | 11.36 | 0.83 | |
| ENSBackbone=Llama3.1-8B, Fine-tuning method=LoRA, Evaluation protocol=OBQA->ARC-E2026.07 | 86.56 | 7.21 | 0.44 | |
| DALorRABackbone=Llama3.1-8B, Fine-tuning method=LoRA, Evaluation protocol=OBQA->ARC-E, Monte Carlo samples (M)=102026.07 | 86.56 | 3.81 | 0.4 | |
| PoLAR-VBLL (w/o LA)Backbone=Llama-3.1-8B, Training dataset=OBQA2026.04 | 85.92 | 4.09 | 0.44 | |
| PoLAR-VBLLBackbone=Llama-3.1-8B, Training dataset=OBQA2026.04 | 85.92 | 3.89 | 0.42 | |
| TFB-LLBackbone=Llama-3.1-8B, Training dataset=OBQA2026.04 | 85.74 | 5.35 | 0.39 | |
| MLEBackbone=Llama-3.1-8B, Training dataset=OBQA2026.04 | 85.66 | 10.31 | 0.63 | |
| LABackbone=Llama-3.1-8B, Training dataset=OBQA2026.04 | 85.66 | 5.09 | 0.39 | |
| PoLAR-MLEBackbone=Llama-3.1-8B, Training dataset=OBQA2026.04 | 85.57 | 8.35 | 0.5 | |
| PoLAR-LABackbone=Llama-3.1-8B, Training dataset=OBQA2026.04 | 85.57 | 5.19 | 0.42 | |
| PoLAR-LA-LLBackbone=Llama-3.1-8B, Training dataset=OBQA2026.04 | 85.57 | 7.27 | 0.48 | |
| C-LoRABackbone=Llama3.1-8B, Fine-tuning method=LoRA, Evaluation protocol=OBQA->ARC-E, Monte Carlo samples (M)=102026.07 | 85.48 | 5.63 | 0.48 | |
| C-LoRABackbone=Llama-3.1-8B, Training dataset=OBQA2026.04 | 85.04 | 10.38 | 0.63 | |
| TFBBackbone=Llama-3.1-8B, Training dataset=OBQA2026.04 | 84.5 | 4.03 | 0.44 | |
| PoLAR-BLoBBackbone=Llama-3.1-8B, Training dataset=OBQA2026.04 | 84.29 | 3.76 | 0.41 | |
| BLoBBackbone=Llama-3.1-8B, Training dataset=OBQA2026.04 | 84.2 | 5.05 | 0.41 |