ResearchBenchmarksSummarization on Summarize datasetFollow0.6433Win RateCFA0.558540.5805450.602550.624555Jan 24, 2026Evaluation ResultsMethodMethodLinksWin RateCFAModel Backbone=Llama3....Model Backbone=Llama3.1, Baseline=Base_DPO, Evaluation Judge=GPT-4o2026.010.6433CFAModel Backbone=Qwen2.5...Model Backbone=Qwen2.5, Baseline=Base_DPO, Evaluation Judge=GPT-4o2026.010.5761CFAModel Backbone=Llama2,...Model Backbone=Llama2, Baseline=Base_DPO, Evaluation Judge=GPT-4o2026.010.5618