Human-Object Interaction Detection on V-COCO (AP Role Scenarios)
73.6AP Role (Scenario 1)InCoM-Net
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| InCoM-NetBackbone=R50+CLIP, Vision Encoder=ViT-L2026.04 | 73.6 | 75.4 | |
| InCoM-NetBackbone=R50+CLIP, Vision Encoder=ViT-B2026.04 | 72.2 | 74.2 | |
| MGNMLBackbone=Swin-L+CLIP, Architecture Style=Two-stage2025.09 | 71.2 | 74.5 | |
| NMSRBackbone=R50+CLIP, Vision Encoder=ViT-L2026.04 | 69.8 | 72.1 | |
| HORP-LBackbone=Swin-L+CLIP+Gaze, Architecture Style=Two-stage2025.09 | 68.9 | 71.1 | |
| MGNMBackbone=R50+CLIP, Architecture Style=Two-stage2025.09 | 68.9 | 70.6 | |
| RLIPv2Backbone=Swin-T+BLIP, Architecture Style=Two-stage2025.09 | 68.8 | 70.8 | |
| SPLHOIBackbone=R50+BLIP2, Vision Encoder=ViT-L2026.04 | 68.1 | 72.9 | |
| ScriptHOI2026.05 | 67.8 | 69.4 | |
| InterProDaBackbone=R50+CLIP, Vision Encoder=ViT-L2026.04 | 67.6 | — | |
| SCTCBackbone=R50+CLIP, Vision Encoder=ViT-B2026.04 | 67.1 | 71.7 | |
| GroupHOIBackbone=R50+CLIP, Vision Encoder=ViT-L2026.04 | 66.4 | 67.3 | |
| MP-HOIBackbone=R50+CLIP+SD, Architecture Style=One-stage2025.09 | 66.2 | 67.6 | |
| ContextHOIBackbone=R50+CLIP, Vision Encoder=ViT-L2026.04 | 66.1 | — | |
| STIPBackbone=R502026.04 | 66 | 70.7 | |
| CLIP4HOI2026.05 | 66 | 67.5 | |
| BCOMBackbone=R50+CLIP, Vision Encoder=ViT-L2026.04 | 65.8 | 69.9 | |
| DiffHOI-LBackbone=Swin-L+CLIP+SD, Architecture Style=One-stage2025.09 | 65.7 | 68.2 | |
| HORPBackbone=R50+CLIP+Gaze, Architecture Style=Two-stage2025.09 | 65.6 | 68.3 | |
| HORPBackbone=R50+CLIP, Vision Encoder=ViT-B2026.04 | 65.6 | 68.3 | |
| UniHOIBackbone=R50+BLIP2, Vision Encoder=ViT-L2026.04 | 65.6 | 68.3 | |
| GEN-VLKT2026.05 | 65.6 | 67.2 | |
| GroupHOIBackbone=R50+CLIP, Vision Encoder=ViT-B2026.04 | 65 | 66 | |
| PViC-LBackbone=Swin-L, Architecture Style=Two-stage2025.09 | 64.1 | 70.2 | |
| CDN2026.05 | 63.9 | 65.9 | |
| RmLRBackbone=R502026.04 | 63.8 | 69.8 | |
| DOQBackbone=R50+CLIP, Architecture Style=One-stage2025.09 | 63.5 | — | |
| HOICLIPBackbone=R50+CLIP, Vision Encoder=ViT-B2026.04 | 63.5 | 64.8 | |
| ILCNBackbone=Swin-T, Architecture Style=Two-stage2025.09 | 63.4 | 65.3 | |
| LAINBackbone=R50+CLIP, Architecture Style=Two-stage2025.09 | 63.4 | 65.3 | |
| Pose-awareBackbone=Swin-L+ViTPose, Architecture Style=Two-stage2025.09 | 63 | 68.7 | |
| PViCBackbone=R50, Architecture Style=Two-stage2025.09 | 62.8 | 67.8 | |
| PViCBackbone=R502026.04 | 62.8 | 67.8 | |
| GEN-VLKTBackbone=R50+CLIP, Vision Encoder=ViT-B2026.04 | 62.4 | 64.5 | |
| CDTBackbone=R50, Architecture Style=One-stage2025.09 | 61.4 | 65.4 | |
| DiffHOIBackbone=R50+CLIP+SD, Architecture Style=One-stage2025.09 | 61.1 | 63.5 | |
| ViPLOBackbone=R101-DC+CLIP+ViTPose, Architecture Style=Two-stage2025.09 | 60.9 | 66.6 | |
| UPTBackbone=R101, Architecture Style=Two-stage2025.09 | 60.7 | 66.2 | |
| VDRPBackbone=R50+CLIP, Vision Encoder=ViT-L2026.04 | 60.6 | 66.2 | |
| FGAHOIBackbone=Swin-T, Architecture Style=One-stage2025.09 | 60.5 | 61.2 | |
| HOLaBackbone=R50+CLIP, Vision Encoder=ViT-L2026.04 | 60.3 | 66 | |
| UPTBackbone=R502026.04 | 59 | 64.5 | |
| QPICBackbone=R502026.04 | 58.8 | 61 | |
| QPIC2026.05 | 58.8 | 61 | |
| ADA-CMBackbone=R50+CLIP, Vision Encoder=ViT-L2026.04 | 58.6 | 64 | |
| ADA-CMBackbone=R50+CLIP, Architecture Style=Two-stage2025.09 | 56.1 | 61.5 | |
| HOTR2026.05 | 55.2 | 64.4 | |
| SCGBackbone=R50, Architecture Style=Two-stage2025.09 | 54.2 | 60.9 | |
| AS-NetBackbone=R50, Architecture Style=One-stage2025.09 | 53.9 | — | |
| DRG2026.05 | 51 | 56.4 | |
| VCL2026.05 | 48.3 | 54.7 | |
| UnionDetBackbone=R50, Architecture Style=One-stage2025.09 | 47.5 | 56.2 | |
| iCAN2026.05 | 45.3 | 52.4 | |
| CLIP4HOIBackbone=R50+CLIP, Vision Encoder=ViT-B2026.04 | — | 66.3 | |
| CMMPBackbone=R50+CLIP, Vision Encoder=ViT-L2026.04 | — | 64 | |
| LAINBackbone=R50+CLIP, Vision Encoder=ViT-B2026.04 | — | 65.1 |