Few-shot video recognition on HMDB-51
0.612Top-1 Acc (K=2)Zero-ViCLIP + MSTA + Lcc
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Zero-ViCLIP + MSTA + LccGFLOPs=179.84, Transfer learning protocol=Efficient transfer pre-trained models, Multi-view inference=true2024.11 | 0.612 | 0.623 | 0.671 | 0.704 | |
| MOTEGFLOPs=141, Transfer learning protocol=Tuning pre-trained models, Multi-view inference=true2024.11 | 0.61 | 0.637 | 0.669 | 0.685 | |
| Zero-ViCLIP + MSTAGFLOPs=179.84, Transfer learning protocol=Efficient transfer pre-trained models, Multi-view inference=true2024.11 | 0.601 | 0.622 | 0.668 | 0.699 | |
| OSTTransfer learning protocol=Tuning pre-trained models, Multi-view inference=true2024.11 | 0.6 | 0.625 | 0.656 | 0.673 | |
| Zero-ViCLIP + AdaptFormerGFLOPs=179.80, Transfer learning protocol=Efficient transfer pre-trained models, Multi-view inference=true2024.11 | 0.6 | 0.618 | 0.666 | 0.701 | |
| Zero-ViCLIP + LORAGFLOPs=179.80, Transfer learning protocol=Efficient transfer pre-trained models, Multi-view inference=true2024.11 | 0.594 | 0.614 | 0.665 | 0.694 | |
| Vanilla CLIPGFLOPs=282, Transfer learning protocol=Tuning pre-trained models, Multi-view inference=true2024.11 | 0.578 | 0.612 | 0.656 | 0.667 | |
| ViFi-CLIPGFLOPs=281, Transfer learning protocol=Tuning pre-trained models, Multi-view inference=true2024.11 | 0.575 | 0.629 | 0.647 | 0.666 | |
| ViCLIPGFLOPs=161, Transfer learning protocol=Tuning pre-trained models, Multi-view inference=true2024.11 | 0.537 | 0.604 | 0.645 | 0.703 | |
| XCLIPGFLOPs=145, Transfer learning protocol=Adapting pre-trained models, Multi-view inference=true2024.11 | 0.535 | 0.578 | 0.629 | 0.645 | |
| Zero-ViCLIPGFLOPs=161, Transfer learning protocol=Efficient transfer pre-trained models, Multi-view inference=true2024.11 | 0.478 | 0.478 | 0.478 | 0.478 | |
| A5GFLOPs=284, Transfer learning protocol=Adapting pre-trained models, Multi-view inference=true2024.11 | 0.412 | 0.513 | 0.565 | 0.627 | |
| Vanilla CLIPGFLOPs=281, Transfer learning protocol=Zero-shot pre-trained models, Multi-view inference=true2024.11 | 0.372 | 0.372 | 0.372 | 0.372 |