Categories
Companies
Research
Sign in
Join
Loading the SOTA2 catalog…
WizWand is now SOTA2 Research
SOTA2
Research
Papers
Benchmarks
Datasets
Tasks
LLM (Chat & Instruction) AI research – Page 80 · SOTA2 Research
Back to Research
Research domain
LLM (Chat & Instruction)
Search tasks
Search
1 benchmarks · 1 papers
Plausibility
1 benchmarks · 1 papers
Model Utility Maintenance
1 benchmarks · 1 papers
Intent-conditioned model selection
1 benchmarks · 1 papers
Interaction Alignment (User Study)
1 benchmarks · 1 papers
Multi-task Agent Execution
1 benchmarks · 1 papers
Jailbreak and Phishing Prompt Classification
1 benchmarks · 1 papers
Jailbreak Prompt Classification
1 benchmarks · 1 papers
Individual Alignment (User Study)
1 benchmarks · 1 papers
Expert Red Teaming
1 benchmarks · 2 papers
General-purpose Multimodal Understanding
1 benchmarks · 1 papers
Offline Synthetic Data Generation
1 benchmarks · 1 papers
Turn-level dialogue quality evaluation (Uses Knowledge)
1 benchmarks · 1 papers
LLM Evaluation Agreement
1 benchmarks · 1 papers
Phrase Protection
1 benchmarks · 1 papers
Housing Consultation
1 benchmarks · 1 papers
Spatial Navigation and Reasoning
1 benchmarks · 1 papers
Proactive Agent Task Execution
1 benchmarks · 1 papers
Multi-session Psychological Counseling
1 benchmarks · 1 papers
Hallucination Evaluation (Discriminative)
1 benchmarks · 2 papers
Hallucination Evaluation (Generative)
1 benchmarks · 1 papers
Moral Drift Characterization
1 benchmarks · 1 papers
LLM Judge Agreement
1 benchmarks · 1 papers
Multi-turn Dependency Reasoning
1 benchmarks · 1 papers
Reasoning step reduction
1 benchmarks · 1 papers
Early-stopping for mathematical reasoning
1 benchmarks · 1 papers
Zero-shot Text Evaluation
1 benchmarks · 1 papers
Human Fluency Evaluation
1 benchmarks · 1 papers
Automated failure mode detection alignment
1 benchmarks · 1 papers
Reasoning Performance and Sycophancy Evaluation
1 benchmarks · 1 papers
Agentic Memory Management
1 benchmarks · 1 papers
Image-Response Generation
1 benchmarks · 1 papers
Story-level evaluation
Page 80 of 154
Previous
Next