Truthfulness Detection on HaluEval (test)
93.89QA AccuracyTruthV(argmax)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| TruthV(argmax)Model=Llama-3.2-3B-Instruct2025.09 | 93.89 | 67.59 | 59.1 | 73.53 | |
| TruthV(argmin)Model=Llama-3.2-3B-Instruct2025.09 | 93.74 | 67.4 | 59.18 | 73.44 | |
| TruthV(argmax)Model=Gemma-2-2B-it2025.09 | 89.63 | 68.36 | 63.87 | 73.95 | |
| TruthV(argmax)Model=Qwen3-4B2025.09 | 89.58 | 70.02 | 83.6 | 81.07 | |
| TruthV(argmin)Model=Gemma-2-2B-it2025.09 | 89.57 | 68.89 | 64.23 | 74.23 | |
| TruthV(argmin)Model=Qwen3-4B2025.09 | 89.28 | 69.43 | 83.5 | 80.74 | |
| TruthV(argmin)Model=Llama-2-7B-Chat2025.09 | 80.2 | 57.35 | 60.61 | 66.05 | |
| TruthV(argmax)Model=Llama-2-7B-Chat2025.09 | 79.71 | 57.28 | 61.37 | 66.12 | |
| NoVoModel=Gemma-2-2B-it2025.09 | 78.88 | 62.06 | 60.52 | 67.15 | |
| NoVoModel=Qwen3-4B2025.09 | 78.42 | 67.22 | 67.45 | 71.03 | |
| NoVoModel=Llama-3.2-3B-Instruct2025.09 | 70.99 | 61.67 | 57.08 | 63.25 | |
| Log-LikelihoodModel=Gemma-2-2B-it2025.09 | 67.34 | 59.23 | 52.43 | 59.67 | |
| NoVoModel=Llama-2-7B-Chat2025.09 | 65.51 | 56.94 | 56.27 | 59.57 | |
| Log-LikelihoodModel=Llama-3.2-3B-Instruct2025.09 | 53.27 | 54.32 | 51.7 | 53.1 | |
| Log-LikelihoodModel=Llama-2-7B-Chat2025.09 | 48.93 | 49.38 | 52.49 | 50.27 | |
| Log-LikelihoodModel=Qwen3-4B2025.09 | 46.99 | 59.42 | 45.52 | 50.64 |