Question Answering on TriviaQA Single-Answer
1.89ECETrained Probe
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Trained ProbeSetting=supervised fine-tuning2025.03 | 1.89 | 81.73 | 59.25 | |
| Rewarding DoubtSetting=fine-tuning2025.03 | 2.26 | 85.92 | 63.09 | |
| Self-ConsistencySetting=zero-shot2025.03 | 11.34 | 82.13 | 62.24 | |
| LACIEOptimization=DPO-based2025.03 | 12 | 72 | — | |
| Top-KSetting=zero-shot2025.03 | 16.11 | 66.73 | 60.23 | |
| Chain-of-ThoughtSetting=zero-shot2025.03 | 30.65 | 63.79 | 62.73 | |
| Sequence ProbabilitySetting=zero-shot2025.03 | 31.56 | 78.04 | 59.55 | |
| PPO-MSetting=zero-shot2025.03 | 32.62 | 52.74 | 57.49 | |
| VerbalizeSetting=zero-shot2025.03 | 34.59 | 58.58 | 63.1 | |
| PPO-CSetting=zero-shot2025.03 | 36.07 | 54.39 | 52.58 | |
| Surrogate TokenSetting=zero-shot2025.03 | 36.86 | 59.23 | 59.33 |