Categories
Companies
Research
Sign in
Join
Loading the SOTA2 catalog…
WizWand is now SOTA2 Research
SOTA2
Research
Papers
Benchmarks
Datasets
Tasks
LLM (Chat & Instruction) AI research – Page 26 · SOTA2 Research
Back to Research
Research domain
LLM (Chat & Instruction)
Search tasks
Search
4 benchmarks · 1 papers
Strategic Negotiation
4 benchmarks · 1 papers
Textual understanding
4 benchmarks · 1 papers
Generation correctness prediction
4 benchmarks · 1 papers
Multi-digit Multiplication
4 benchmarks · 1 papers
Inconsistency-tolerant Reasoning
4 benchmarks · 4 papers
Utility assessment
4 benchmarks · 2 papers
Knowledge-grounded dialog
4 benchmarks · 1 papers
Proactive Assistant Evaluation
4 benchmarks · 4 papers
Output Diversity
4 benchmarks · 1 papers
Emotional Support
4 benchmarks · 5 papers
General AI Assistant
4 benchmarks · 1 papers
Jailbreak Transferability
4 benchmarks · 2 papers
Personality Understanding
4 benchmarks · 2 papers
False Refusal Evaluation
4 benchmarks · 14 papers
General AI Assistant Task
4 benchmarks · 1 papers
Tool-use behavioral profiling
4 benchmarks · 1 papers
Transitive reasoning
4 benchmarks · 2 papers
Chat & Instruction Following
4 benchmarks · 4 papers
Narrative Generation
4 benchmarks · 1 papers
Arithmetical puzzle solving
4 benchmarks · 2 papers
Personality Alignment
4 benchmarks · 1 papers
Multilingual Reasoning and Language Understanding
4 benchmarks · 2 papers
Pairwise Human Preference Prediction
4 benchmarks · 1 papers
Reasoning-Aware Threat Detection
4 benchmarks · 2 papers
Long-context recall
4 benchmarks · 2 papers
Long-Horizon Stability
4 benchmarks · 4 papers
Open-ended evaluation
4 benchmarks · 1 papers
Explanation self-consistency
4 benchmarks · 1 papers
Therapeutic Game Evaluation
4 benchmarks · 3 papers
Quantitative Reasoning
4 benchmarks · 2 papers
Pairwise Evaluation
4 benchmarks · 1 papers
Multi-step LLM Interaction
Page 26 of 154
Previous
Next