Loading the SOTA2 catalog…
SOTA2 Research · papers
Find papers, implementations, and the benchmark evidence behind state-of-the-art AI systems.
| YOLOX-PAI: An Improved YOLOX, Stronger and Faster than YOLOv6 |
|---|
| Ziheng Wu, Xinyi Zou, Wenmeng Zhou |
| 2022 |
| arxiv 2208.13040 |
| The Role of Data Curation in Image Captioning | Wenyan Li, Jonas F. Lotz, Chen Qiu | 2023 | arxiv 2305.03610 |
|---|
| D^2ETR: Decoder-Only DETR with Computationally Efficient Cross-Scale Attention | Junyu Lin, Xiaofeng Mao, Yuefeng Chen | 2022 | arxiv 2203.00860 |
|---|
| Deep Multi-Task Networks For Occluded Pedestrian Pose Estimation | Arindam Das, Sudip Das, Ganesh Sistu | 2022 | arxiv 2206.07510 |
|---|
| HintPose | Sanghoon Hong, Hunchul Park, Jonghyuk Park | 2020 | arxiv 2003.02170 |
|---|
| Realtime Multi-Person 2D Pose Estimation using Part Affinity Fields | Zhe Cao, Tomas Simon, Shih-En Wei | 2016 | arxiv 1611.08050 |
|---|
| Exploiting Multiple Sequence Lengths in Fast End to End Training for Image Captioning | Jia Cheng Hu, Roberto Cavicchioli, Alessandro Capotondi | 2022 | arxiv 2208.06551 |
|---|
| AI Safety in Practice: Enhancing Adversarial Robustness in Multimodal Image Captioning | Maisha Binte Rashid, Pablo Rivas | 2024 | arxiv 2407.21174 |
|---|
| GatedUniPose: A Novel Approach for Pose Estimation Combining UniRepLKNet and Gated Convolution | Liang Feng, Ming Xu, Lihua Wen | 2024 | arxiv 2409.07752 |
|---|
| CogVLM: Visual Expert for Pretrained Language Models | Weihan Wang, Qingsong Lv, Wenmeng Yu | 2023 | arxiv 2311.03079 |
|---|