Natural Language Inference on MedNLI (eval)
4.9RiskCRC
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CRCN (EVAL size)=1,422, Err (Base verifier-fail rate)=21.0%, alpha* (Target risk level)=0.202026.05 | 4.9 | — | — | |
| CSAN (EVAL size)=1,422, Err (Base verifier-fail rate)=21.0%, alpha* (Target risk level)=0.202026.05 | 6.7 | 28.9 | 0 | |
| LTTN (EVAL size)=1,422, Err (Base verifier-fail rate)=21.0%, alpha* (Target risk level)=0.202026.05 | 11.4 | — | — | |
| ConfFactN (EVAL size)=1,422, Err (Base verifier-fail rate)=21.0%, alpha* (Target risk level)=0.202026.05 | 13.5 | — | — | |
| 5 online baselinesN (EVAL size)=1,422, Err (Base verifier-fail rate)=21.0%, alpha* (Target risk level)=0.202026.05 | — | — | 10 | |
| NEX-ConfN (EVAL size)=1,422, Err (Base verifier-fail rate)=21.0%, alpha* (Target risk level)=0.202026.05 | — | — | 1 |