Uncertainty Calibration on TriviaQA + Natural Questions ID held-out (test)
7.2ECEEntropy-based (ours)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Entropy-based (ours)Backbone=Qwen2.5-7B-Instruct, Reinforcement learning=GRPO, Reward design=Calibrated entropy-based reward signal2026.03 | 7.2 | 81.53 | 0.67 | |
| BrierBackbone=Qwen2.5-7B-Instruct, Reinforcement learning=GRPO, Reward design=Brier score2026.03 | 15.7 | 83.36 | 0.52 | |
| Base+CoTBackbone=Qwen2.5-7B-Instruct, Reinforcement learning=None, Chain-of-thought reasoning=true2026.03 | 34.17 | 66.18 | 0.17 | |
| BaseBackbone=Qwen2.5-7B-Instruct, Reinforcement learning=None, Chain-of-thought reasoning=false2026.03 | 41.99 | 51.89 | 0.03 |