Categories
Companies
Research
Sign in
Join
Loading the SOTA2 catalog…
WizWand is now SOTA2 Research
SOTA2
Research
Papers
Benchmarks
Datasets
Tasks
Agents & Tool Use AI research – Page 2 · SOTA2 Research
Back to Research
Research domain
Agents & Tool Use
Search tasks
Search
15 benchmarks · 10 papers
Agent
14 benchmarks · 4 papers
Skill retrieval
14 benchmarks · 7 papers
Agent Safety Evaluation
14 benchmarks · 20 papers
GUI Agent Task
14 benchmarks · 6 papers
Interactive Agent Task
13 benchmarks · 6 papers
Agent Task Performance
13 benchmarks · 14 papers
Downstream Task Evaluation
12 benchmarks · 11 papers
Tool Use Reasoning
12 benchmarks · 6 papers
Agent Performance
12 benchmarks · 1 papers
Mobile Device Operation
12 benchmarks · 5 papers
Agent evaluation
11 benchmarks · 2 papers
Autonomous Penetration Testing
11 benchmarks · 3 papers
Tool Planning
11 benchmarks · 7 papers
Multi-turn tool-use
10 benchmarks · 1 papers
Post-shift accepted-trajectory risk estimation
10 benchmarks · 6 papers
Web Agent Task Success
10 benchmarks · 7 papers
Reasoning Quality Evaluation
10 benchmarks · 14 papers
Web Browsing
10 benchmarks · 3 papers
Skill Routing
10 benchmarks · 1 papers
HTN Planning
10 benchmarks · 4 papers
Tool Learning
9 benchmarks · 1 papers
Coding Agent Capacity
9 benchmarks · 3 papers
Web Shopping
9 benchmarks · 4 papers
Tool Usage
9 benchmarks · 3 papers
Web Task Completion
9 benchmarks · 6 papers
Tool-Use Agent Evaluation
9 benchmarks · 4 papers
GUI Agent
9 benchmarks · 3 papers
Task Execution
8 benchmarks · 1 papers
Character Relationship Network Updating
8 benchmarks · 1 papers
Multi-turn task completion
8 benchmarks · 1 papers
Global resource management and long-term strategic planning
8 benchmarks · 4 papers
Task-goal completion
Page 2 of 49
Previous
Next