Loading the SOTA2 catalog…
SOTA2 Research · benchmarks
Compare state-of-the-art methods across the tasks and datasets used to measure AI progress.
| Task | Dataset | Domain | Trend | Results | Last Update |
|---|---|---|---|---|---|
| Medical Image Segmentation | PraNet | 50 | Feb 26, 2026 | ||
| Medical Image Segmentation | EchoNet | 50 | Feb 26, 2026 | ||
| Medical Image Segmentation | SEG | 50 | Feb 26, 2026 | ||
| Medical Image Segmentation | UKBB | 50 | Feb 26, 2026 | ||
| Emotion Perception | EEmo-Bench | 50 | Feb 26, 2026 | ||
| Text-to-Image Generation |
| OneIG EN |
| 50 |
| Jul 3, 2026 |
| Visual Perception | MME Perception | 50 | Mar 13, 2026 |
|---|
| Classical Image Super-Resolution | Urban100 | 50 | Mar 11, 2026 |
|---|
| Grounding | ScreenSpot V2 | 50 | Jun 23, 2026 |
|---|
| Large Language Model Evaluation | 10 tasks average | 50 | Feb 26, 2026 |
|---|
| General Knowledge | CMMLU | 50 | May 15, 2026 |
|---|
| Tool-use Agent Performance | τ²-bench | 50 | Jun 30, 2026 |
|---|
| Agentic Evaluation | SimpleQA | 50 | Feb 26, 2026 |
|---|
| Agentic Evaluation | GAIA | 50 | Feb 26, 2026 |
|---|
| Code Generation | HumanEval | 50 | Feb 26, 2026 |
|---|
| Hallucination Detection | SVAMP | 50 | May 28, 2026 |
|---|
| Node Clustering | RedditS | 50 | Jun 15, 2026 |
|---|
| Mathematical Reasoning | Olympiad | 50 | Feb 26, 2026 |
|---|
| Multimodal Reward Modeling | Multimodal RewardBench | 50 | Apr 23, 2026 |
|---|
| Utility Evaluation | Just-Eval | 50 | May 12, 2026 |
|---|
| Classification | Case Study 2 | 50 | May 19, 2026 |
|---|
| Conditional Image Generation | ImageNet 256px 2012 (val) | 50 | Feb 26, 2026 |
|---|
| Commonsense Reasoning | Reasoning Suite Zero-shot Aggregate | 50 | May 25, 2026 |
|---|
| Tool Learning | RestBench TMDB | 50 | Jun 2, 2026 |
|---|
| System Identification | Synthetic dataset | 50 | Feb 26, 2026 |
|---|