ResearchBenchmarksOpen-ended Generation on NoveltyBench, WildChat, and Narrative-Discourse Average (test)Follow49Lexical DominanceAligned-1.64811.50124.6537.799Nov 7, 2025Evaluation ResultsMethodMethodLinksLexical DominanceLexical CoverageSemantic CoverageSemantic DominanceOverall CoverageOverall DominanceAligned2025.114926.910.429.218.639BACOSelection Strategy=BestSelection Strategy=Best2025.1124.944.53640.540.332.7Base2025.1112.79.89.8169.814.3Nudging2025.119.327.624.79.926.19.6PromptingSelection Strategy=BestSelection Strategy=Best2025.112.7——2.2—2.4EnsembleSelection Strategy=BestSelection Strategy=Best2025.111.1——1.9—1.5Decoding2025.110.3——0.3—0.3