Selective Generation on TruthfulQA Out-of-domain
0.283PRR (AlignScore)HUQ-SATRMD
Evaluation Results
| Method | Links | |
|---|---|---|
| HUQ-SATRMDModel=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 0.283 | |
| Maximum Sequence ProbabilityModel=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 0.277 | |
| Semantic EntropyModel=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 0.171 | |
| DegMat NLI Score Entail.Model=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 0.156 | |
| SATRMD+MSPModel=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 0.122 | |
| SARModel=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 0.105 | |
| FactoscopeModel=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 0.045 | |
| SAPLMAModel=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 0.009 |