ResearchBenchmarksLanguage Modeling Utility on LM Eval HarnessFollow0.48HellaSwag AccuracyPre Edit0.4560.4680.480.492Jun 9, 2025Evaluation ResultsMethodMethodLinksHellaSwag AccuracyPerplexity (OpenAI Lambada)Perplexity (Standard Lambada)Perplexity (Wikitext)Winogrande AccuracyPIQA AccuracyPre EditModel State=Pre-editModel State=Pre-edit2025.060.483.985.9610.880.650.76PMEModel State=Post-editModel State=Post-edit2025.060.484.076.4810.890.650.76MEMITModel State=Post-editModel State=Post-edit2025.060.484.246.5910.930.640.76