Context-dependent Visual Reasoning on Bongard-HOI (test)
66.39Accuracy (Seen Act, Seen Obj)TPT
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| TPTBackbone=CLIP-RN502022.09 | 66.39 | 68.5 | 65.98 | 65.48 | 66.59 | |
| HOITrans2022.09 | 59.5 | 64.38 | 63.1 | 62.87 | 62.46 | |
| Meta-baselineBackbone=ResNet-50, Ground truth bounding boxes=true2022.09 | 58.82 | 58.75 | 58.56 | 57.04 | 58.3 | |
| CNN-baselineBackbone=ResNet-502022.09 | 50.03 | 49.89 | 49.77 | 50.01 | 49.92 |