Uncertainty Calibration on GSM8k OOD (test)
3.15ECEEntropy-based (ours)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Entropy-based (ours)Backbone=Qwen2.5-7B-Instruct, Reinforcement learning=GRPO, Reward design=Calibrated entropy-based reward signal2026.03 | 3.15 | 66.73 | |
| Base+CoTBackbone=Qwen2.5-7B-Instruct, Reinforcement learning=None, Chain-of-thought reasoning=true2026.03 | 22.25 | 62.17 | |
| BaseBackbone=Qwen2.5-7B-Instruct, Reinforcement learning=None, Chain-of-thought reasoning=false2026.03 | 32.22 | 53.79 | |
| BrierBackbone=Qwen2.5-7B-Instruct, Reinforcement learning=GRPO, Reward design=Brier score2026.03 | 33.28 | 66.89 |