Loading the SOTA2 catalog…
SOTA2 Research · tasks
Explore the problems researchers are working on and the benchmarks used to measure progress.
| Task Name | Domain | Benchmarks | Papers | Last Update |
|---|---|---|---|---|
| Emotional Support Conversation Response Generation | 1 | 1 | Feb 18, 2026 | |
| Teamwork components prediction | 1 | 1 | May 6, 2026 | |
| Career exploration outcome assessment | 1 | 1 | Feb 22, 2026 | |
| Trait Alignment | 1 | 1 | May 6, 2026 | |
| Zero-shot Language Model Evaluation | 1 | 1 | May 7, 2026 | |
| Human-AI Hybridization | 1 | 1 | May 7, 2026 | |
| Competition Math Grading | 1 | 1 | Feb 22, 2026 | |
| Multimodal Conversational Question Answering | 1 | 1 | May 7, 2026 | |
| Helpful response generation |
| 1 |
| 1 |
| Feb 18, 2026 |
| LLM Inference Efficiency Optimization | 1 | 1 | May 7, 2026 |
|---|
| Multi-turn Jailbreak Detection | 1 | 1 | Feb 22, 2026 |
|---|
| Subject Knowledge Evaluation | 1 | 1 | May 7, 2026 |
|---|
| Probabilistic Model Calibration | 1 | 1 | May 7, 2026 |
|---|
| Safety Overrefusal Evaluation | 1 | 1 | Feb 22, 2026 |
|---|
| Conformal Hallucination Detection | 1 | 1 | May 7, 2026 |
|---|
| Automated Essay Scoring analytic feedback | 1 | 1 | May 7, 2026 |
|---|
| Long-range Modeling | 1 | 1 | May 7, 2026 |
|---|
| Fact Retention | 1 | 1 | May 7, 2026 |
|---|
| Fact retention accuracy | 1 | 1 | May 7, 2026 |
|---|
| LLM Inference Verification | 1 | 1 | Feb 22, 2026 |
|---|
| Domain-specific Alignment | 1 | 1 | May 7, 2026 |
|---|
| Strategy-based Question Answering | 1 | 2 | Apr 23, 2026 |
|---|
| Generalist Alignment | 1 | 1 | May 7, 2026 |
|---|
| Long-horizon Research Task Reproduction | 1 | 1 | Feb 22, 2026 |
|---|
| Opponent modeling | 1 | 1 | May 7, 2026 |
|---|