Loading the SOTA2 catalog…
Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization · SOTA2 Research