Robot Policy Learning on Franka Kitchen online evaluation in simulation
65.6Knob Turn SuccessCroBo
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| CroBoBackbone=ViT-S/16, Pre-training=Kinetics-400, Visual representations=frozen, Policy head architecture=2-layer MLP, Input viewpoints=left and right2026.03 | 65.6 | 87.6 | 99.4 | 41.2 | 64.8 | |
| ToBoBackbone=ViT-S/16, Pre-training=Kinetics-400, Visual representations=frozen, Policy head architecture=2-layer MLP, Input viewpoints=left and right2026.03 | 58.4 | 80.6 | 98.4 | 44.2 | 51.2 | |
| CropMAEBackbone=ViT-S/16, Pre-training=Kinetics-400, Visual representations=frozen, Policy head architecture=2-layer MLP, Input viewpoints=left and right2026.03 | 33 | 65 | 89.6 | 22.6 | 25 | |
| RSPBackbone=ViT-S/16, Pre-training=Kinetics-400, Visual representations=frozen, Policy head architecture=2-layer MLP, Input viewpoints=left and right2026.03 | 33 | 44.8 | 89.6 | 25.8 | 33.4 | |
| DINOBackbone=ViT-S/16, Pre-training=Kinetics-400, Visual representations=frozen, Policy head architecture=2-layer MLP, Input viewpoints=left and right2026.03 | 27 | 44.3 | 77 | 16.5 | 28.5 | |
| DINOv2Visual representations=frozen, Policy head architecture=2-layer MLP, Input viewpoints=left and right2026.03 | 25 | 46.6 | 87.8 | 17.6 | 21.8 | |
| SiamMAEBackbone=ViT-S/16, Pre-training=Kinetics-400, Visual representations=frozen, Policy head architecture=2-layer MLP, Input viewpoints=left and right2026.03 | 16.8 | 36.5 | 68 | 17.3 | 13.5 | |
| MAEBackbone=ViT-S/16, Pre-training=Kinetics-400, Visual representations=frozen, Policy head architecture=2-layer MLP, Input viewpoints=left and right2026.03 | 12 | 24.3 | 71.5 | 12.8 | 10 |