Loading the SOTA2 catalog…
CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning · SOTA2 Research