ResearchBenchmarksReasoning Consistency Evaluation on MMLU-ProFollow52.9LAFF ScoreGPT-OSS13.06823.40933.7544.091May 27, 2026Evaluation ResultsMethodMethodLinksLAFF ScoreLAFF 95% CI (Lower Bound)Sample Size (n)GPT-OSSModel=GPT-OSS-20B, Rea...Model=GPT-OSS-20B, Reasoning Mode=think2026.0552.93117Qwen3Model=Qwen3-32B, Reaso...Model=Qwen3-32B, Reasoning Mode=think2026.05503540Gemma-4Model=Gemma-4-31B-it,...Model=Gemma-4-31B-it, Reasoning Mode=inline2026.0522.269Qwen3Model=Qwen3-32B, Reaso...Model=Qwen3-32B, Reasoning Mode=no_think2026.0514.6982