Vision-based robot policy learning on Franka Kitchen
57Knob 1 Success RateToBo
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| ToBoBackbone=ViT-S/16, Pre-training dataset=Kinetics-400, Evaluation protocol=Imitation learning2025.07 | 57 | 82 | 95 | 51 | 55 | |
| CropMAEBackbone=ViT-S/16, Pre-training dataset=Kinetics-400, Evaluation protocol=Imitation learning2025.07 | 31.5 | 54 | 77 | 25.5 | 32.5 | |
| RSPBackbone=ViT-S/16, Pre-training dataset=Kinetics-400, Evaluation protocol=Imitation learning2025.07 | 31 | 44.5 | 82.5 | 28.8 | 30.3 | |
| DINOBackbone=ViT-S/16, Pre-training dataset=Kinetics-400, Evaluation protocol=Imitation learning2025.07 | 27 | 44.3 | 77 | 16.5 | 28.5 | |
| SimCLRBackbone=ViT-S/16, Pre-training dataset=Kinetics-400, Evaluation protocol=Imitation learning2025.07 | 25.3 | 55.8 | 72.3 | 17 | 23.3 | |
| SiamMAEBackbone=ViT-S/16, Pre-training dataset=Kinetics-400, Evaluation protocol=Imitation learning2025.07 | 16.8 | 36.5 | 68 | 17.3 | 13.5 | |
| MAEBackbone=ViT-S/16, Pre-training dataset=Kinetics-400, Evaluation protocol=Imitation learning2025.07 | 12 | 24.3 | 71.5 | 12.8 | 10 | |
| MoCo v3Backbone=ViT-S/16, Pre-training dataset=Kinetics-400, Evaluation protocol=Imitation learning2025.07 | 11.5 | 24.3 | 66.5 | 10.3 | 14.3 |