Categories
Companies
Research
Sign in
Join
Loading the SOTA2 catalog…
WizWand is now SOTA2 Research
SOTA2
Research
Papers
Benchmarks
Datasets
Tasks
LLM (Chat & Instruction) AI research – Page 34 · SOTA2 Research
Back to Research
Research domain
LLM (Chat & Instruction)
Search tasks
Search
3 benchmarks · 4 papers
Interactive Instruction Following
3 benchmarks · 1 papers
Multi-agent Cognitive Orchestration
3 benchmarks · 1 papers
Individualistic Value Reasoning
3 benchmarks · 1 papers
Medical Long-form Answering
3 benchmarks · 1 papers
Preference Labeling
3 benchmarks · 1 papers
Controllable multi-objective generation
3 benchmarks · 4 papers
Social Interaction
3 benchmarks · 1 papers
Follow-up Question Answering
3 benchmarks · 1 papers
Dialogue Policy Evaluation
3 benchmarks · 10 papers
Large Multimodal Model Evaluation
3 benchmarks · 1 papers
Pairwise LLM Evaluation
3 benchmarks · 1 papers
Multi-hop reasoning and question answering
3 benchmarks · 1 papers
AlpacaEval 2.0
3 benchmarks · 2 papers
Multi-hop Question Generation
3 benchmarks · 3 papers
Instruction-based Video Editing
3 benchmarks · 1 papers
Long-form Question Answering refinement
3 benchmarks · 1 papers
Bayesian Assessment of Sycophancy
3 benchmarks · 1 papers
Sycophancy Assessment
3 benchmarks · 1 papers
Long-form generation factuality and uncertainty estimation
3 benchmarks · 2 papers
Reasoning accuracy
3 benchmarks · 1 papers
Tool-use Inference
3 benchmarks · 1 papers
Reasoning trace quality evaluation
3 benchmarks · 1 papers
Policy Question Answering
3 benchmarks · 1 papers
Output Equivalence
3 benchmarks · 1 papers
Fine-grained Knowledge Recall
3 benchmarks · 1 papers
Multi-turn dialogue routing
3 benchmarks · 3 papers
Open-ended Reasoning
3 benchmarks · 1 papers
Linear Concept Accessibility and Steering
3 benchmarks · 1 papers
Goal-relevance Evaluation
3 benchmarks · 1 papers
Long-form factuality evaluation
3 benchmarks · 1 papers
LLM Generation Efficiency
3 benchmarks · 3 papers
Binary Addition
Page 34 of 154
Previous
Next