Uncertainty Quantification on τ2-bench Retail
0.899AUROCSonnet-4.6
Evaluation Results
| Method | Links | |
|---|---|---|
| Sonnet-4.6Training=false, Backbone=Qwen3.5-9B2026.06 | 0.899 | |
| Sonnet-4.6Training=false, Backbone=Qwen3-14B2026.06 | 0.864 | |
| Sonnet-4.6Training=false, Backbone=Gemma4-4B2026.06 | 0.852 | |
| Progress AdvantageTraining=false, Backbone=Gemma4-4B2026.06 | 0.69 | |
| WildReward-8BTraining=true, Backbone=Qwen3-14B2026.06 | 0.689 | |
| Progress AdvantageTraining=false, Backbone=Qwen3.5-9B2026.06 | 0.678 | |
| ThinkPRM-7BTraining=true, Backbone=Olmo3-7B2026.06 | 0.67 | |
| Progress AdvantageTraining=false, Backbone=Olmo3-7B2026.06 | 0.664 | |
| Sonnet-4.6Training=false, Backbone=Olmo3-7B2026.06 | 0.656 | |
| Progress AdvantageTraining=false, Backbone=Qwen3-14B2026.06 | 0.65 | |
| WildReward-8BTraining=true, Backbone=Gemma4-4B2026.06 | 0.643 | |
| ThinkPRM-14BTraining=true, Backbone=Qwen3-14B2026.06 | 0.637 | |
| ThinkPRM-14BTraining=true, Backbone=Qwen3.5-9B2026.06 | 0.61 | |
| Self-CertaintyTraining=false, Backbone=Qwen3-14B2026.06 | 0.608 | |
| DeepConf TailTraining=false, Backbone=Olmo3-7B2026.06 | 0.608 | |
| WildReward-8BTraining=true, Backbone=Olmo3-7B2026.06 | 0.584 | |
| DeepConf B10Training=false, Backbone=Qwen3-14B2026.06 | 0.582 | |
| ThinkPRM-14BTraining=true, Backbone=Gemma4-4B2026.06 | 0.573 | |
| ThinkPRM-7BTraining=true, Backbone=Qwen3.5-9B2026.06 | 0.551 | |
| ThinkPRM-14BTraining=true, Backbone=Olmo3-7B2026.06 | 0.544 | |
| ThinkPRM-7BTraining=true, Backbone=Qwen3-14B2026.06 | 0.543 | |
| DeepConf B10Training=false, Backbone=Qwen3.5-9B2026.06 | 0.496 | |
| ThinkPRM-7BTraining=true, Backbone=Gemma4-4B2026.06 | 0.469 | |
| WildReward-8BTraining=true, Backbone=Qwen3.5-9B2026.06 | 0.468 | |
| DeepConf B10Training=false, Backbone=Gemma4-4B2026.06 | 0.416 | |
| Self-CertaintyTraining=false, Backbone=Gemma4-4B2026.06 | 0.397 | |
| Self-CertaintyTraining=false, Backbone=Olmo3-7B2026.06 | 0.392 | |
| DeepConf TailTraining=false, Backbone=Gemma4-4B2026.06 | 0.382 | |
| DeepConf TailTraining=false, Backbone=Qwen3-14B2026.06 | 0.38 | |
| Self-CertaintyTraining=false, Backbone=Qwen3.5-9B2026.06 | 0.366 | |
| DeepConf TailTraining=false, Backbone=Qwen3.5-9B2026.06 | 0.344 | |
| DeepConf B10Training=false, Backbone=Olmo3-7B2026.06 | 0.288 |