Uncertainty Quantification on τ2-bench Airline
86.5AUROCProgress Advantage
Evaluation Results
| Method | Links | |
|---|---|---|
| Progress AdvantageTraining=false, Backbone=Gemma4-4B2026.06 | 86.5 | |
| Self-CertaintyTraining=false, Backbone=Gemma4-4B2026.06 | 84 | |
| DeepConf B10Training=false, Backbone=Gemma4-4B2026.06 | 83.4 | |
| Progress AdvantageTraining=false, Backbone=Olmo3-7B2026.06 | 79.9 | |
| Progress AdvantageTraining=false, Backbone=Qwen3-14B2026.06 | 73.9 | |
| Sonnet-4.6Training=false, Backbone=Qwen3.5-9B2026.06 | 72.6 | |
| Progress AdvantageTraining=false, Backbone=Qwen3.5-9B2026.06 | 72 | |
| Sonnet-4.6Training=false, Backbone=Olmo3-7B2026.06 | 71.5 | |
| ThinkPRM-14BTraining=true, Backbone=Olmo3-7B2026.06 | 70.8 | |
| DeepConf TailTraining=false, Backbone=Qwen3-14B2026.06 | 68.2 | |
| Self-CertaintyTraining=false, Backbone=Qwen3-14B2026.06 | 66.3 | |
| ThinkPRM-14BTraining=true, Backbone=Qwen3.5-9B2026.06 | 65.5 | |
| Self-CertaintyTraining=false, Backbone=Qwen3.5-9B2026.06 | 64.2 | |
| DeepConf B10Training=false, Backbone=Qwen3-14B2026.06 | 63.6 | |
| DeepConf B10Training=false, Backbone=Olmo3-7B2026.06 | 61.8 | |
| Sonnet-4.6Training=false, Backbone=Gemma4-4B2026.06 | 61.5 | |
| DeepConf TailTraining=false, Backbone=Qwen3.5-9B2026.06 | 58.8 | |
| DeepConf B10Training=false, Backbone=Qwen3.5-9B2026.06 | 58.7 | |
| ThinkPRM-7BTraining=true, Backbone=Qwen3.5-9B2026.06 | 58.2 | |
| DeepConf TailTraining=false, Backbone=Gemma4-4B2026.06 | 58.1 | |
| WildReward-8BTraining=true, Backbone=Qwen3.5-9B2026.06 | 54 | |
| Sonnet-4.6Training=false, Backbone=Qwen3-14B2026.06 | 51.9 | |
| WildReward-8BTraining=true, Backbone=Olmo3-7B2026.06 | 51.4 | |
| ThinkPRM-7BTraining=true, Backbone=Olmo3-7B2026.06 | 49.2 | |
| Self-CertaintyTraining=false, Backbone=Olmo3-7B2026.06 | 48.6 | |
| ThinkPRM-7BTraining=true, Backbone=Gemma4-4B2026.06 | 47.8 | |
| DeepConf TailTraining=false, Backbone=Olmo3-7B2026.06 | 47.2 | |
| ThinkPRM-14BTraining=true, Backbone=Gemma4-4B2026.06 | 42.6 | |
| WildReward-8BTraining=true, Backbone=Qwen3-14B2026.06 | 31.4 | |
| WildReward-8BTraining=true, Backbone=Gemma4-4B2026.06 | 31.2 | |
| ThinkPRM-14BTraining=true, Backbone=Qwen3-14B2026.06 | 29.2 | |
| ThinkPRM-7BTraining=true, Backbone=Qwen3-14B2026.06 | 27.6 |