Multiple-Choice Question Answering on TruthfulQA MC1
76.2MC1 AccuracyEdgeJury
Evaluation Results
| Method | Links | |
|---|---|---|
| EdgeJuryvariant=Full2025.12 | 76.2 | |
| RAG-S1Retrieval-Augmentation=true2025.12 | 72.1 | |
| LATBackbone=LLaMA-2-Chat 70B, Stimulus Set=Stimulus 22023.10 | 69.8 | |
| LATBackbone=LLaMA-2-Chat 70B, Stimulus Set=Stimulus 32023.10 | 69.8 | |
| SC5k=52025.12 | 68.1 | |
| MVstrategy=Majority Vote2025.12 | 67.8 | |
| SC3k=32025.12 | 66.4 | |
| LATBackbone=LLaMA-2-Chat 70B, Stimulus Set=Stimulus 12023.10 | 65.9 | |
| S1k=12025.12 | 62.8 | |
| LAT (Average)Backbone=Average (LLaMA-2-Chat 7B, 13B, 70B), Stimulus Set=Stimulus 32023.10 | 60.7 | |
| LAT (Average)Backbone=Average (LLaMA-2-Chat 7B, 13B, 70B), Stimulus Set=Stimulus 22023.10 | 60.6 | |
| Heuristic Zero-shotBackbone=LLaMA-2-Chat 70B2023.10 | 59.2 | |
| LATBackbone=LLaMA-2-Chat 7B, Stimulus Set=Stimulus 22023.10 | 58.9 | |
| LATBackbone=LLaMA-2-Chat 7B, Stimulus Set=Stimulus 32023.10 | 58.2 | |
| LAT (Average)Backbone=Average (LLaMA-2-Chat 7B, 13B, 70B), Stimulus Set=Stimulus 12023.10 | 56.8 | |
| LATBackbone=LLaMA-2-Chat 7B, Stimulus Set=Stimulus 12023.10 | 55 | |
| LATBackbone=LLaMA-2-Chat 13B, Stimulus Set=Stimulus 32023.10 | 54.2 | |
| LATBackbone=LLaMA-2-Chat 13B, Stimulus Set=Stimulus 22023.10 | 53.1 | |
| Heuristic Zero-shotBackbone=LLaMA-2-Chat 13B2023.10 | 50.3 | |
| Spherical SteeringZero-shot=true, Backbone=LLaMA-3.1-8B-Instruct2026.02 | 49.95 | |
| LATBackbone=LLaMA-2-Chat 13B, Stimulus Set=Stimulus 12023.10 | 49.6 | |
| SafeNeuronModel Series=LLaMA Series, Number of Parameters=8B2026.02 | 48.84 | |
| Heuristic Zero-shot (Average)Backbone=Average (LLaMA-2-Chat 7B, 13B, 70B)2023.10 | 47.2 | |
| MiCA (optimal)Base Model=Qwen2.5-7B-Instr., r=32, LR=5e-4, Ep.=8, Params=6M2026.04 | 43.38 | |
| Qwen2.5-7B-Instr.Params=7,626M2026.04 | 43.27 | |
| LoRA (optimal)Base Model=Qwen2.5-7B-Instr., r=32, LR=5e-4, Ep.=4, Params=10M2026.04 | 42.95 | |
| SADI-HEADZero-shot=true, Backbone=LLaMA-3.1-8B-Instruct2026.02 | 38.53 | |
| ITIZero-shot=true, Backbone=LLaMA-3.1-8B-Instruct2026.02 | 37.7 | |
| CAAZero-shot=true, Backbone=LLaMA-3.1-8B-Instruct2026.02 | 35.99 | |
| Standard Zero-shotBackbone=LLaMA-2-Chat 13B2023.10 | 35.9 | |
| LoRA (optimal)Base Model=Llama-2-7B-chat, r=128, LR=1e-4, Ep.=8, Params=67M2026.04 | 35.47 | |
| MiCA (optimal)Base Model=Llama-2-7B-chat, r=16, LR=5e-4, Ep.=4, Params=4M2026.04 | 35.29 | |
| Llama-2-7B-chatParams=6,747M2026.04 | 34.79 | |
| BaselineZero-shot=true, Backbone=LLaMA-3.1-8B-Instruct2026.02 | 34.15 | |
| SafeNeuronModel Series=Qwen Series, Number of Parameters=1.5B2026.02 | 33.54 | |
| Standard Zero-shot (Average)Backbone=Average (LLaMA-2-Chat 7B, 13B, 70B)2023.10 | 32.3 | |
| Heuristic Zero-shotBackbone=LLaMA-2-Chat 7B2023.10 | 32.2 | |
| Standard Zero-shotBackbone=LLaMA-2-Chat 7B2023.10 | 31 | |
| Standard Zero-shotBackbone=LLaMA-2-Chat 70B2023.10 | 29.9 |