Selective Generation on PubMedQA
0.372PRR (ROUGE-L)SATRMD+MSP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SATRMD+MSPModel=Llama 8b v3.12025.02 | 0.372 | 0.202 | |
| HUQ-SATRMDModel=Llama 8b v3.12025.02 | 0.351 | 0.211 | |
| SAPLMAModel=Llama 8b v3.12025.02 | 0.24 | 0.155 | |
| PerplexityModel=Llama 8b v3.12025.02 | 0.215 | -0.044 | |
| Lexical Similarity ROUGE-LModel=Llama 8b v3.12025.02 | 0.144 | 0.041 | |
| SARModel=Llama 8b v3.12025.02 | 0.122 | 0.032 | |
| EigenScoreModel=Llama 8b v3.12025.02 | 0.074 | 0.027 | |
| DegMat NLI Score Entail.Model=Llama 8b v3.12025.02 | 0.064 | 0.058 | |
| Semantic EntropyModel=Llama 8b v3.12025.02 | 0.064 | 0.034 | |
| EigValLaplacian NLI Score Entail.Model=Llama 8b v3.12025.02 | 0.054 | 0.054 | |
| Eccentricity NLI Score Entail.Model=Llama 8b v3.12025.02 | 0.033 | 0.021 | |
| SentenceSARModel=Llama 8b v3.12025.02 | 0 | 0.006 | |
| FactoscopeModel=Llama 8b v3.12025.02 | -0.035 | 0.001 | |
| Maximum Sequence ProbabilityModel=Llama 8b v3.12025.02 | -0.155 | -0.011 |