Loading the SOTA2 catalog…
SOTA2 Research · papers
Find papers, implementations, and the benchmark evidence behind state-of-the-art AI systems.
| Weifeng Lin, Ziheng Wu, Jiayu Chen |
| 2023 |
| arxiv 2307.08579 |
| Semantic Segmentation and Scene Reconstruction of RGB-D Image Frames: An End-to-End Modular Pipeline for Robotic Applications | Zhiwu Zheng, Lauren Mentzer, Berk Iskender | 2024 | arxiv 2410.17988 |
|---|
| OneFormer: One Transformer to Rule Universal Image Segmentation | Jitesh Jain, Jiachen Li, MangTik Chiu | 2022 | arxiv 2211.06220 |
|---|
| MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models | Chenglin Yang, Siyuan Qiao, Qihang Yu | 2022 | arxiv 2210.01820 |
|---|
| Polyline Path Masked Attention for Vision Transformer | Zhongchen Zhao, Chaodong Xiao, Hui Lin | 2025 | arxiv 2506.15940 |
|---|
| Dual-Domain Representation Alignment: Bridging 2D and 3D Vision via Geometry-Aware Architecture Search | Haoyu Zhang, Zhihao Yu, Rui Wang | 2026 | arxiv 2603.19563 |
|---|
| Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders | Yitong Jiang, Hongjun Wang, Collin McCarthy | 2026 | arxiv 2606.00746 |
|---|
| Norm$\times$Direction: Restoring the Missing Query Norm in Vision Linear Attention | Weikang Meng, Yadan Luo, Liangyu Huo | 2025 | arxiv 2506.21137 |
|---|
| Large-batch Optimization for Dense Visual Predictions | Zeyue Xue, Jianming Liang, Guanglu Song | 2022 | arxiv 2210.11078 |
|---|
| AdPE: Adversarial Positional Embeddings for Pretraining Vision Transformers via MAE+ | Xiao Wang, Ying Wang, Ziwei Xuan | 2023 | arxiv 2303.07598 |
|---|