Categories
Companies
Research
Sign in
Join
Loading the SOTA2 catalog…
WizWand is now SOTA2 Research
SOTA2
Research
Papers
Benchmarks
Datasets
Tasks
Agents & Tool Use AI research – Page 29 · SOTA2 Research
Back to Research
Research domain
Agents & Tool Use
Search tasks
Search
1 benchmarks · 1 papers
Planning and puzzle solving
1 benchmarks · 1 papers
Agent Survival Analysis
1 benchmarks · 1 papers
E-commerce risk management single-step trajectory evaluation
1 benchmarks · 1 papers
E-commerce risk management multi-step trajectory evaluation
1 benchmarks · 1 papers
Multi-Agent Clinical Evaluation
1 benchmarks · 1 papers
General GUI navigation
1 benchmarks · 1 papers
Tool Error Detection
1 benchmarks · 1 papers
Aggregate performance across 10 tasks
1 benchmarks · 1 papers
Multi-Agent Route Planning
1 benchmarks · 1 papers
General Assistant
1 benchmarks · 1 papers
Behavior Tree Generation
1 benchmarks · 1 papers
Plug-In Operation
1 benchmarks · 1 papers
Sim Agents Simulation
1 benchmarks · 1 papers
BrowseComp-Plus
1 benchmarks · 1 papers
Collaborative Plan Acquisition
1 benchmarks · 1 papers
Dialogue Agent Evaluation
1 benchmarks · 1 papers
Tool-based Question Answering
1 benchmarks · 1 papers
Tool Summarization
1 benchmarks · 1 papers
Calendar Scheduling
1 benchmarks · 1 papers
Social Deduction Game Play
1 benchmarks · 1 papers
High-level task planning and completion
1 benchmarks · 1 papers
Tower of Hanoi
1 benchmarks · 1 papers
Heads-Up Limit Hold'em Poker
1 benchmarks · 1 papers
Reasoning and Acting
1 benchmarks · 1 papers
Tool-use Execution
1 benchmarks · 1 papers
Tool-use Search Evaluation
1 benchmarks · 1 papers
Interactive web shopping and navigation
1 benchmarks · 1 papers
Agentic Dialogue
1 benchmarks · 1 papers
Planning and Tool Use
1 benchmarks · 1 papers
Web Agent Search and Reasoning
1 benchmarks · 1 papers
Web Browsing Agent
1 benchmarks · 1 papers
Web Browsing and Interaction
Page 29 of 49
Previous
Next