Categories
Companies
Research
Sign in
Join
Loading the SOTA2 catalog…
WizWand is now SOTA2 Research
SOTA2
Research
Papers
Benchmarks
Datasets
Tasks
LLM (Chat & Instruction) AI research – Page 70 · SOTA2 Research
Back to Research
Research domain
LLM (Chat & Instruction)
Search tasks
Search
1 benchmarks · 1 papers
Multi-turn Psychological Counseling Dialogue Generation
1 benchmarks · 1 papers
Synthetic recall
1 benchmarks · 1 papers
Many-shot in-context learning
1 benchmarks · 1 papers
Multi-round co-reference resolution
1 benchmarks · 1 papers
Preference Adaptation
1 benchmarks · 1 papers
Fact chaining & relational reasoning
1 benchmarks · 2 papers
Chat Benchmark
1 benchmarks · 1 papers
Novelty Alignment
1 benchmarks · 1 papers
Generation w/ citations
1 benchmarks · 1 papers
Cultural Pluralism Alignment (Cultural Knowledge)
1 benchmarks · 2 papers
Multimodal Dialogue Generation
1 benchmarks · 1 papers
Cultural Pluralism Alignment (Cultural Values)
1 benchmarks · 1 papers
Interactive Serving
1 benchmarks · 1 papers
Vision-Language Interaction Evaluation
1 benchmarks · 1 papers
Reasoning and Language Modeling
1 benchmarks · 1 papers
Behavioral Deviation Detection
1 benchmarks · 1 papers
Macro-average Reasoning
1 benchmarks · 1 papers
CBT skill scoring
1 benchmarks · 1 papers
Helpfulness, Honesty, and Harmlessness Alignment Evaluation
1 benchmarks · 1 papers
Multi-source Answer Generation
1 benchmarks · 1 papers
Dialogic Deference Evaluation
1 benchmarks · 2 papers
Long-context retrieval and synthetic reasoning
1 benchmarks · 1 papers
Large Language Model Alignment
1 benchmarks · 1 papers
Professional-level Knowledge Acquisition
1 benchmarks · 1 papers
Expert-level Understanding
1 benchmarks · 1 papers
Mental Healthcare Support Response Evaluation
1 benchmarks · 1 papers
Deductive Video Reasoning
1 benchmarks · 1 papers
Underspecified Prompting
1 benchmarks · 1 papers
Persona-driven decision-making
1 benchmarks · 1 papers
Instructional Dialogue Evaluation
1 benchmarks · 1 papers
Free-format Multimodal Hallucination Assessment
1 benchmarks · 1 papers
Psychological Simulation Evaluation
Page 70 of 154
Previous
Next