Video-to-image affordance grounding on OPRA fine-grained 256 x 256
1.48Heatmap KLDMaskAHand
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MaskAHandProtocol=Fine-tune, Backbone=ResNet-50-Afformer2023.03 | 1.48 | 52.5 | |
| AfformerBackbone=ViTDet-B2023.03 | 1.51 | 52.27 | |
| AfformerBackbone=ResNet-502023.03 | 1.55 | 52.14 | |
| MaskAHandProtocol=Fine-tune, Backbone=ResNet-50, Architecture=Deconv2023.03 | 1.74 | 48.93 | |
| Naive BaselineBackbone=ResNet-50, Decoder=Deconv2023.03 | 2.2 | 45.66 | |
| Demo2VecVariants=Motion + TSA + ConvLSTM2023.03 | 2.34 | 40.79 | |
| MaskAHandProtocol=Zero-shot, Backbone=ResNet-50-Afformer2023.03 | 2.36 | — | |
| MaskAHandProtocol=Zero-shot, Backbone=ResNet-50, Architecture=Deconv2023.03 | 2.89 | — | |
| Demo2VecVariants=ConvLSTM2023.03 | 3.31 | 30.2 | |
| Demo2VecVariants=TSA + ConvLSTM2023.03 | 3.34 | 38.47 | |
| Demo2VecVariants=LSTM2023.03 | 3.45 | 20.41 |