Long-horizon Embodied Manipulation on RoboTwin 35 long-horizon tasks
64.58Average Success RateV-CAGE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| V-CAGEData Generation Framework=VLM-based semantic verification and dynamic context-aware instantiation, Policy Architecture=Diffusion-based, Evaluation Protocol=Success rates averaged over 35 tasks2026.01 | 64.58 | 100 | 100 | |
| VanillaData Generation Framework=Open-loop generation (LLM planner and code generation only), Policy Architecture=Diffusion-based, Evaluation Protocol=Success rates averaged over 35 tasks2026.01 | 46.86 | 92 | 77 |