ResearchTasksPreference-Aligned Reinforcement LearningFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedStraighten Rope Pass WaterPrefVLM4.1Label Count4Jul 3, 2026Fold ClothPrefVLM1,790Label Metric4Jul 3, 2026MetaWorldPrefVLM21,000Label Score4Jul 3, 2026