ResearchBenchmarksInstruction Tuning on Anthropic HH (test)Follow56.3Win RateSCAR54.84455.22255.655.978Dec 3, 2025Evaluation ResultsMethodMethodLinksWin RateSCARComparison Baseline=RL...Comparison Baseline=RLHF, LLM Judge=gpt-4-turbo, Evaluation Framework=AlpacaEval2025.1256.3SCARComparison Baseline=AB...Comparison Baseline=ABC, LLM Judge=gpt-4-turbo, Evaluation Framework=AlpacaEval2025.1254.9