ResearchBenchmarksPreference-Aligned Reinforcement Learning on MetaWorldFollow21,000Label ScorePrefVLM-3205,21510,75016,285Jul 2, 2026Evaluation ResultsMethodMethodLinksLabel ScoreImage ScorePrefVLM2026.0721,0002,000RL-VLM-F2026.075,00010,000ERL-VLM2026.074,9004,900CoRe2026.075004,000