ResearchBenchmarksReadability and difficulty-controlled text generation on OSEFollow0.8453AccuracySWAI0.2664360.4167180.5670.717282Jan 16, 2026Evaluation ResultsMethodMethodLinksAccuracyF1 ScorePrecisionRecallConfidence ScoreCohen's Kappa (κ)Matthews Corr. Coeff. (MCC)SWAIModel=Llama3.1 8BModel=Llama3.1 8B2026.010.84530.8450.84530.84530.8470.7680.768SWAIModel=Llama3.2 1BModel=Llama3.2 1B2026.010.71110.7120.71270.71110.8050.5670.567BaselineModel=Llama3.1 8BModel=Llama3.1 8B2026.010.37110.3630.3620.36480.8460.0520.052BaselineModel=Llama3.2 1BModel=Llama3.2 1B2026.010.28870.2890.29360.28990.826-0.063-0.064