ResearchBenchmarksEducational Feedback Generation on SEFL (test)Follow57Win Rate (vs GPT-4o)SEFL42.4446.225053.78Feb 18, 2025Evaluation ResultsMethodMethodLinksWin Rate (vs GPT-4o)Win Rate (vs Claude 3.5 Sonnet)Win Rate (vs DeepSeek V3)SEFLBackbone=Qwen2.5-14B,...Backbone=Qwen2.5-14B, Evaluation Protocol=LLM-as-a-Judge2025.02576373Book2DialBackbone=Qwen2.5-14B,...Backbone=Qwen2.5-14B, Evaluation Protocol=LLM-as-a-Judge, Data size=5,300 conversation pairs2025.02433727