Tool-augmented general task solving on AgentDojo
94.8Success RatePass@N (oracle)
Evaluation Results
| Method | Links | |
|---|---|---|
| Pass@N (oracle)Training=false, Backbone=Qwen3.5-9B2026.06 | 94.8 | |
| Greedy DecodingTraining=false, Backbone=Qwen3.5-9B2026.06 | 94.8 | |
| Progress AdvantageTraining=false, Backbone=Qwen3.5-9B2026.06 | 91.8 | |
| Mean-of-NTraining=false, Backbone=Qwen3.5-9B2026.06 | 89 | |
| ThinkPRM-14BTraining=true, Backbone=Qwen3.5-9B2026.06 | 88.7 | |
| WildReward-8BTraining=true, Backbone=Qwen3.5-9B2026.06 | 86.6 | |
| DeepConf TailTraining=false, Backbone=Qwen3.5-9B2026.06 | 86.6 | |
| DeepConf B10Training=false, Backbone=Qwen3.5-9B2026.06 | 86.6 | |
| ThinkPRM-7BTraining=true, Backbone=Qwen3.5-9B2026.06 | 85.6 | |
| Self-CertaintyTraining=false, Backbone=Qwen3.5-9B2026.06 | 85.6 | |
| Pass@N (oracle)Training=false, Backbone=Gemma4-4B2026.06 | 48.5 | |
| Greedy DecodingTraining=false, Backbone=Gemma4-4B2026.06 | 48.5 | |
| ThinkPRM-14BTraining=true, Backbone=Gemma4-4B2026.06 | 44.3 | |
| WildReward-8BTraining=true, Backbone=Gemma4-4B2026.06 | 43.3 | |
| Progress AdvantageTraining=false, Backbone=Gemma4-4B2026.06 | 43.3 | |
| Mean-of-NTraining=false, Backbone=Gemma4-4B2026.06 | 38.8 | |
| ThinkPRM-7BTraining=true, Backbone=Gemma4-4B2026.06 | 37.1 | |
| DeepConf TailTraining=false, Backbone=Gemma4-4B2026.06 | 35.1 | |
| Self-CertaintyTraining=false, Backbone=Gemma4-4B2026.06 | 33 | |
| DeepConf B10Training=false, Backbone=Gemma4-4B2026.06 | 30.9 |