Human-Object Interaction Detection on HICO-DET (test)
62.09mAP (full)ViPLO_l
Evaluation Results
| Method | Links | ||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ViPLO_lBackbone=ViT-B/16, Evaluation Setting=Default, Bounding Box Source=Ground Truth2023.04 | 62.09 | 59.26 | 62.93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViPLO_sBackbone=ViT-B/32, Evaluation Setting=Default, Bounding Box Source=Ground Truth2023.04 | 58.23 | 54.08 | 59.46 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SCGBackbone=ResNet-50-FPN, Evaluation Setting=Default, Bounding Box Source=Ground Truth2023.04 | 51.53 | 41.01 | 54.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Spatially Conditioned GraphsBackbone=ResNet-50-FPN, Detector Training Setting=Oracle2020.12 | 51.53 | 41.01 | 54.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PViC+Backbone=Swin-L, Attention Feature Augmentation=true2025.01 | 46.49 | 47.43 | 46.21 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FCL + VCLObject Detector=Ground Truth2021.03 | 45.25 | 36.27 | 47.94 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RLIPv2Backbone=Swin-L, Category=Additional training with object detection data2024.08 | 45.1 | 45.6 | 43.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RLIPv2Backbone=Swin-L2025.01 | 45.09 | 43.23 | 45.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MP-HOI-LBackbone=Swin-L, Pre-training Data=Magic-HOI+SynHOI, 286K+2024.06 | 44.53 | 44.48 | 44.55 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PViC w/ H-DETRBackbone=Swin-L2025.01 | 44.32 | 44.61 | 44.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PVICBackbone=Swin-L, Category=Additional training with object detection data2024.08 | 44.3 | 44.6 | 44.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ATLBackbone=ResNet-50, Evaluation Setting=Default, Bounding Box Source=Ground Truth2023.04 | 44.27 | 35.52 | 46.89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FCLObject Detector=Ground Truth2021.03 | 44.26 | 35.46 | 46.88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FCLBackbone=ResNet-50, Evaluation Setting=Default, Bounding Box Source=Ground Truth2023.04 | 44.26 | 35.46 | 46.88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IDNBackbone=ResNet-50, Evaluation Setting=Default, Bounding Box Source=Ground Truth2023.04 | 43.98 | 40.27 | 45.09 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IDNBackbone=ResNet50, Detector Training Setting=Oracle2020.12 | 43.98 | 40.27 | 45.09 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PViCBackbone=Swin-L, Fine-tuned=false2024.06 | 43.35 | 42.25 | 43.69 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VCLObject Detector=Ground Truth2021.03 | 43.09 | 32.56 | 46.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VCLBackbone=ResNet-50, Evaluation Setting=Default, Bounding Box Source=Ground Truth2023.04 | 43.09 | 32.56 | 46.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ADA-CM + ADCBackbone=R502025.11 | 39.81 | 41.48 | 39.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EZ-HOI + ADCBackbone=R502025.11 | 39.8 | 41.85 | 39.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ADA-CM + BoostAdapterBackbone=R502025.11 | 38.75 | 39.01 | 38.68 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EZ-HOIMethod Type=Two-stage, Supervision Setting=Fully-supervised2024.10 | 38.61 | 37.7 | 38.89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ADA-CMMethod Type=Two-stage, Supervision Setting=Fully-supervised2024.10 | 38.4 | 37.52 | 38.66 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ADA-CMBackbone=R502025.11 | 38.39 | 37.46 | 38.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EZ-HOIBackbone=R502025.11 | 38.33 | 36.7 | 38.82 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FleVRSBackbone=Focal-L, Category=Single-stage methods2024.08 | 38.1 | 33 | 39.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HOIGEN + ADCBackbone=R502025.11 | 37.95 | 40.67 | 37.14 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SCTCBackbone=R502025.11 | 37.92 | 34.78 | 38.86 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniVRDBackbone=ViT-L, Category=Additional training with object detection data2024.08 | 37.4 | 28.9 | 39.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViPLOBackbone=ViT-B2025.11 | 37.22 | 35.45 | 37.75 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VIPLOBackbone=ViT-B, Category=Bottom-up methods2024.08 | 37.2 | 35.5 | 37.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FGAHOIBackbone=Swin-L, Fine-tuned=false2024.06 | 37.18 | 30.71 | 39.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AGERMethod Type=One-stage, Supervision Setting=Fully-supervised2024.10 | 36.75 | 33.53 | 37.71 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MP-HOI-SBackbone=ResNet-50, Pre-training Data=Magic-HOI+SynHOI, 286K+2024.06 | 36.5 | 35.48 | 36.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DiffHOI-LZero-shot Setting=RF-UC2023.05 | 36.16 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 28.76 | 38.01 | — | — | — | — | — | |
| ERNetBackbone=EfficientNetV2-XL, Category=Single-stage methods2024.08 | 35.9 | 30.1 | 38.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QAHOIBackbone=Swin-L, Fine-tuned=false2024.06 | 35.78 | 29.8 | 37.56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LogicHOIMethod Type=One-stage, Supervision Setting=Fully-supervised2024.10 | 35.47 | 32.03 | 36.22 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LOGICHOIBackbone=R502025.11 | 35.47 | 32.03 | 36.22 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EZ-HOI + BoostAdapterBackbone=R502025.11 | 35.45 | 34.58 | 38.35 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RLIPv2Backbone=ResNet-50, Fine-tuned=true, Pre-training Data=VG+COCO+O365, 2200K+2024.06 | 35.38 | 29.61 | 37.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RLIPv2Method Type=One-stage, Supervision Setting=Fully-supervised2024.10 | 35.38 | 29.61 | 37.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RLIPv2Backbone=R502025.11 | 35.38 | 29.61 | 37.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP4HOIMethod Type=Two-stage, Supervision Setting=Fully-supervised2024.10 | 35.33 | 33.95 | 35.75 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DiffHOI-LZero-shot Setting=UV2023.05 | 35.04 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 24.2 | 36.81 | — | — | — | — | — | |
| GEN-VLKTBackbone=ResNet-101, Category=Single-stage methods2024.08 | 35 | 31.2 | 36.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TIN+GT-PaStaNet*-LinearBackbone=ResNet-50, Knowledge Module=GT-PaStaNet*, Knowledge Architecture=Linear2020.04 | 34.86 | 42.83 | 32.48 | — | — | — | — | — | — | — | 35.59 | 42.94 | 33.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HOIGEN + BoostAdapterBackbone=R502025.11 | 34.83 | 35.37 | 34.47 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HOICLIPMethod Type=One-stage, Supervision Setting=Fully-supervised2024.10 | 34.69 | 31.12 | 35.74 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PViCBackbone=R502025.11 | 34.69 | 32.14 | 35.45 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HOICLIPBackbone=R502025.11 | 34.69 | 31.12 | 35.74 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Peyre et al.Backbone=ResNet-50-FPN, Detector Training Setting=Oracle2020.12 | 34.35 | 27.57 | 36.38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TINBackbone=ResNet-50, Evaluation Setting=Default, Bounding Box Source=Ground Truth2023.04 | 34.26 | 22.9 | 37.65 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TINBackbone=ResNet50, Detector Training Setting=Oracle2020.12 | 34.26 | 22.9 | 37.65 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GEN + SpeaQreproduced_result=true2024.03 | 34 | 30.2 | 35.13 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PViCBackbone=ResNet-50, Fine-tuned=false2024.06 | 33.8 | 29.28 | 35.15 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GEN-VLKTBackbone=ResNet-50, Fine-tuned=false2024.06 | 33.75 | 29.25 | 35.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GEN-VLKTMethod Type=One-stage, Supervision Setting=Fully-supervised2024.10 | 33.75 | 29.25 | 35.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GENVLKTBackbone=R502025.11 | 33.75 | 29.25 | 35.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HOIGENBackbone=R502025.11 | 33.56 | 32.1 | 34 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IFBackbone=ResNet-50, Fine-tuned=false2024.06 | 33.51 | 30.3 | 34.46 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| iCANBackbone=ResNet-50, Evaluation Setting=Default, Bounding Box Source=Ground Truth2023.04 | 33.38 | 21.43 | 36.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| iCANBackbone=ResNet-50, Detector Training Setting=Oracle2020.12 | 33.38 | 21.43 | 36.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DOQBackbone=ResNet-50, Fine-tuned=false2024.06 | 33.28 | 29.19 | 34.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GENreproduced_result=true2024.03 | 33.12 | 27.12 | 34.91 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HOICLIPZero-shot setting=RF-UC, Training-free enhancement=true2023.03 | 32.99 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 25.53 | 34.85 | — | — | — | — | — | |
| MURENBackbone=ResNet-50, Category=Single-stage methods2024.08 | 32.9 | 28.7 | 34.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MURENBackbone=R50, Feature=A2023.04 | 32.87 | 28.67 | 34.12 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RLIP-ParSePT Data=COCO+VG, PTP=RLIP (Init from COCO OD), Detector=DETR, Backbone=ResNet-502022.09 | 32.84 | 26.85 | 34.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RLIPBackbone=R502025.11 | 32.84 | 26.85 | 34.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RLIPBackbone=ResNet-50, Category=Single-stage methods, Training Data=VG+COCO2024.08 | 32.8 | 26.9 | 34.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ParSeBackbone=ResNet-101, Decoding Layers (DL)=6, Pre-training paradigm (PTP)=OD, Pre-training data (PT data)=COCO, Tuning Epochs=902022.09 | 32.76 | 28.59 | 34.01 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ParSePT Data=COCO, PTP=OD, Detector=DETR, Backbone=ResNet-1012022.09 | 32.76 | 28.59 | 34.01 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DIFFUSIONHOIType=UV2024.10 | 32.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 28.05 | 33.24 | — | — | — | — | — | |
| UPTBackbone=ResNet-101-DC52021.12 | 32.62 | 28.62 | 33.81 | — | — | — | — | — | — | — | 36.08 | 31.41 | 37.47 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UPTMethod Type=Two-stage, Supervision Setting=Fully-supervised2024.10 | 32.62 | 28.62 | 33.81 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UPTBackbone=R502025.11 | 32.62 | 28.62 | 33.81 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UPTBackbone=ResNet-101, Category=Bottom-up methods2024.08 | 32.6 | 28.6 | 33.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UPTBackbone=ResNet-1012021.12 | 32.31 | 28.55 | 33.44 | — | — | — | — | — | — | — | 35.65 | 31.6 | 36.86 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HOICLIPZero-shot setting=RF-UC, Training-free enhancement=false2023.03 | 32.26 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 23.48 | 34.47 | — | — | — | — | — | |
| HOICLIPPretrained Detector=true2025.03 | 32.26 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 23.48 | 34.47 | — | — | — | — | — | |
| STIPBackbone=R50, Feature=A+S+L, Training Setting=Jointly fine-tune object detector & HOI detector2022.06 | 32.22 | 28.15 | 33.43 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| STIPBackbone=R50, Feature=A+S+L2023.04 | 32.22 | 28.15 | 33.43 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| STIPBackbone=ResNet-50, Category=Bottom-up methods2024.08 | 32.2 | 28.2 | 33.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FCL + VCLObject Detector=DRG [12]2021.03 | 32.17 | 26 | 34.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CDNBackbone=ResNet-101, Category=Single-stage methods2024.08 | 32.1 | 27.2 | 33.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CDN-LBackbone=ResNet-101, Decoding Layers (DL)=12, Pre-training paradigm (PTP)=OD, Pre-training data (PT data)=COCO, Tuning Epochs=90+102022.09 | 32.07 | 27.19 | 33.53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CDNBackbone=R101, Feature=A2023.04 | 32.07 | 27.19 | 33.53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ParSePT Data=COCO, PTP=OD, Detector=DETR, Backbone=ResNet-502022.09 | 31.79 | 26.36 | 33.41 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DisTRBackbone=R50, Feature=A2023.04 | 31.75 | 27.45 | 33.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UPTBackbone=ResNet-502021.12 | 31.66 | 25.94 | 33.36 | — | — | — | — | — | — | — | 35.05 | 29.27 | 36.77 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UPTBackbone=R50, Feature=A+S2023.04 | 31.66 | 25.94 | 33.36 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UPT2024.03 | 31.66 | 25.94 | 33.36 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| STIPBackbone=R50, Feature=A, Training Setting=Jointly fine-tune object detector & HOI detector2022.06 | 31.6 | 27.75 | 32.75 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CDNPT Data=COCO, PTP=OD, Detector=DETR, Backbone=ResNet-502022.09 | 31.44 | 27.39 | 32.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CDN2024.03 | 31.44 | 27.39 | 32.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CDNBackbone=ResNet-50, Fine-tuned=false2024.06 | 31.44 | 27.39 | 32.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OCNCategory=One-stage, Backbone=R1012022.02 | 31.43 | 25.8 | 33.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenCatPretrained Detector=true2025.03 | 31.38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 21.46 | 33.86 | — | — | — | — | — |