Loading the SOTA2 catalog…
SOTA2 Research · benchmarks
Compare state-of-the-art methods across the tasks and datasets used to measure AI progress.
| Task | Dataset | Domain | Trend | Results | Last Update |
|---|---|---|---|---|---|
| Visual Question Answering | PhD-icc | 60 | Jun 17, 2026 | ||
| Visual Question Answering | Conflict-VQA | 60 | Jun 17, 2026 | ||
| Relational Reasoning | CLUTRR | 60 | Jun 15, 2026 | ||
| Commonsense Reasoning | ARC-Easy, ARC-Challenge, and HellaSwag Average | 60 | Jun 11, 2026 | ||
| Zero-shot Evaluation | Zero-shot Benchmarks Average |
| 60 |
| Jun 11, 2026 |
| Generalized Eigensolving | Thermal Diffusion N=50000 | 60 | Jun 11, 2026 |
|---|
| Generalized Eigensolving | Piezoelectric Coupled-Field N=50000 | 60 | Jun 11, 2026 |
|---|
| Generalized Eigensolving | EM Cavity (N=50000) | 60 | Jun 11, 2026 |
|---|
| Generalized Eigensolving | EGFR Electronic N=50000 | 60 | Jun 11, 2026 |
|---|
| Generalized Eigensolving | Kirchhoff-Love Plate N=50000 | 60 | Jun 11, 2026 |
|---|
| Causal Language Model Pre-training | OpenWebText | 60 | Jun 9, 2026 |
|---|
| Model Calibration | ImageNet 200 | 60 | Jun 4, 2026 |
|---|
| Image Captioning | COCO | 60 | Jun 4, 2026 |
|---|
| Image Classification | Fine-Grained iNat-21, SUN, Aircraft, CUB, CIFAR-10 | 60 | Jun 4, 2026 |
|---|
| Safety Defense Evaluation | Math | 60 | Jun 4, 2026 |
|---|
| Safety Defense Evaluation | Medicine | 60 | Jun 4, 2026 |
|---|
| Jailbreak Defense | Llama model jailbreak evaluation prompts | 60 | Jun 4, 2026 |
|---|
| Image Classification | PathMNIST | 60 | Jun 2, 2026 |
|---|
| Multimodal Understanding | MMT | 60 | Jun 2, 2026 |
|---|
| Web Search | BrowseComp-Plus | 60 | Jun 1, 2026 |
|---|
| Reasoning | MMLU-Pro | 60 | Jul 3, 2026 |
|---|
| Set Ranking | Friendster (Severe) | 60 | May 29, 2026 |
|---|
| Set Ranking | Friendster (Mild) | 60 | May 29, 2026 |
|---|
| Set Ranking | Friendster (Overall) | 60 | May 29, 2026 |
|---|
| Similar Set Ranking | Friendster Clean | 60 | May 29, 2026 |
|---|