Categories
Companies
Research
Sign in
Join
Loading the SOTA2 catalog…
WizWand is now SOTA2 Research
SOTA2
Research
Papers
Benchmarks
Datasets
Tasks
LLM (Chat & Instruction) AI research – Page 42 · SOTA2 Research
Back to Research
Research domain
LLM (Chat & Instruction)
Search tasks
Search
3 benchmarks · 1 papers
20 Questions
3 benchmarks · 1 papers
Goal-relevance Evaluation
3 benchmarks · 1 papers
Fine-grained Knowledge Recall
3 benchmarks · 1 papers
Multi-turn dialogue routing
3 benchmarks · 1 papers
Sycophancy Assessment
3 benchmarks · 1 papers
LLM-as-a-Judge Evaluation Consistency
3 benchmarks · 1 papers
Strategic AI Persuasion (Sender)
3 benchmarks · 1 papers
Strategic AI Persuasion (Receiver)
3 benchmarks · 1 papers
Mathematical Reasoning (Calculator)
3 benchmarks · 2 papers
Video Preference Alignment
3 benchmarks · 2 papers
Social Deduction Game Gameplay
3 benchmarks · 1 papers
Multi-modal Preference Evaluation
3 benchmarks · 1 papers
Stylized Text Generation
3 benchmarks · 1 papers
LoRA Adapter Transfer
3 benchmarks · 2 papers
Memory Evaluation
3 benchmarks · 2 papers
Hallucination Examination
3 benchmarks · 1 papers
Self-confidence estimation
3 benchmarks · 4 papers
Multimodal Medical Reasoning
3 benchmarks · 2 papers
Toxicity Steering
3 benchmarks · 2 papers
Text-to-Image In-Context Learning
3 benchmarks · 1 papers
Detective Puzzle Reasoning
3 benchmarks · 1 papers
Bayesian Assessment of Sycophancy
3 benchmarks · 1 papers
Long-form factuality evaluation
3 benchmarks · 2 papers
Multi-turn Jailbreak
3 benchmarks · 1 papers
Skill Learning
3 benchmarks · 2 papers
Jailbreaking MLLMs
2 benchmarks · 1 papers
Skill Invocation Safety Auditing
2 benchmarks · 1 papers
Real-trace replay validation
2 benchmarks · 1 papers
Multi-turn Jailbreak Evaluation
2 benchmarks · 1 papers
Branching Accuracy
2 benchmarks · 1 papers
Math Word Problem Preference
2 benchmarks · 1 papers
Broad Knowledge Question Answering
Page 42 of 154
Previous
Next