Honesty Alignment on Natural Questions (NQ) In-Domain
85.16AUROCEliCal
Evaluation Results
| Method | Links | |
|---|---|---|
| EliCalModel=Qwen-7B, Regime=Upper Bound, Sample Size=560k2025.10 | 85.16 | |
| Cal-OnlyModel=Qwen-7B, Regime=Upper Bound, Sample Size=560k2025.10 | 84.89 | |
| EliCalModel=Qwen-14B, Regime=Upper Bound, Sample Size=560k2025.10 | 84.57 | |
| Cal-OnlyModel=Qwen-14B, Regime=Upper Bound, Sample Size=560k2025.10 | 83.95 | |
| EliCalModel=Qwen-7B, Regime=Training-based, Sample Size=1k2025.10 | 82.38 | |
| Consis-SemModel=Qwen-7B, Regime=Training-free2025.10 | 80.68 | |
| Consis-SemModel=Llama-8B, Regime=Training-free2025.10 | 80.5 | |
| EliCalModel=Qwen-14B, Regime=Training-based, Sample Size=1k2025.10 | 80.46 | |
| EliCalModel=Llama-8B, Regime=Upper Bound, Sample Size=560k2025.10 | 79.22 | |
| Cal-OnlyModel=Llama-8B, Regime=Upper Bound, Sample Size=560k2025.10 | 78.97 | |
| Eli-OnlyModel=Qwen-7B, Regime=Training-based2025.10 | 77.86 | |
| Consis-SemModel=Qwen-14B, Regime=Training-free2025.10 | 77.77 | |
| Eli-OnlyModel=Qwen-14B, Regime=Training-based2025.10 | 76.92 | |
| EliCalModel=Llama-8B, Regime=Training-based, Sample Size=1k2025.10 | 74.86 | |
| Eli-OnlyModel=Llama-8B, Regime=Training-based2025.10 | 74.21 | |
| Cal-OnlyModel=Qwen-7B, Regime=Training-based, Sample Size=1k2025.10 | 72.19 | |
| Cal-OnlyModel=Qwen-14B, Regime=Training-based, Sample Size=1k2025.10 | 69.62 | |
| Verbal-10Model=Qwen-7B, Regime=Training-free2025.10 | 68.82 | |
| Consis-LexModel=Qwen-14B, Regime=Training-free2025.10 | 68.65 | |
| Cal-OnlyModel=Llama-8B, Regime=Training-based, Sample Size=1k2025.10 | 68.48 | |
| N-ProbModel=Qwen-7B, Regime=Training-free2025.10 | 66.11 | |
| N-ProbModel=Qwen-14B, Regime=Training-free2025.10 | 65.83 | |
| Verbal-10Model=Qwen-14B, Regime=Training-free2025.10 | 65.7 | |
| Verbal-0Model=Qwen-14B, Regime=Training-free2025.10 | 65.33 | |
| Consis-LexModel=Llama-8B, Regime=Training-free2025.10 | 65.32 | |
| Consis-LexModel=Qwen-7B, Regime=Training-free2025.10 | 65.02 | |
| N-ProbModel=Llama-8B, Regime=Training-free2025.10 | 64.25 | |
| Verbal-0Model=Qwen-7B, Regime=Training-free2025.10 | 64.02 | |
| Verbal-0Model=Llama-8B, Regime=Training-free2025.10 | 61.72 | |
| ProbModel=Qwen-14B, Regime=Training-free2025.10 | 61.44 | |
| ProbModel=Qwen-7B, Regime=Training-free2025.10 | 56.79 | |
| Verbal-10Model=Llama-8B, Regime=Training-free2025.10 | 56.08 | |
| ProbModel=Llama-8B, Regime=Training-free2025.10 | 55.53 |