Selective Generation on SciQ Out-of-domain
64.4PRR (AlignScore)HUQ-SATRMD
Evaluation Results
| Method | Links | |
|---|---|---|
| HUQ-SATRMDModel=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 64.4 | |
| SATRMD+MSPModel=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 59.8 | |
| Maximum Sequence ProbabilityModel=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 58.2 | |
| Semantic EntropyModel=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 46.6 | |
| DegMat NLI Score Entail.Model=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 44.6 | |
| SARModel=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 44 | |
| FactoscopeModel=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 42 | |
| SAPLMAModel=Llama 8b v3.1, Evaluation Setting=Out-of-domain, Training Protocol=Leave-one-out2025.02 | 9.1 |