Loading the SOTA2 catalog…
RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization · SOTA2 Research