ResearchBenchmarksReasoning Consistency Evaluation on MT-ConsFollow85.7LAFF ScoreGPT-OSS9.88429.56749.2568.933May 27, 2026Evaluation ResultsMethodMethodLinksLAFF Score95% Confidence IntervalSample Size (n)GPT-OSSModel=GPT-OSS-20B, Rea...Model=GPT-OSS-20B, Reasoning Mode=think2026.0585.76014Qwen3Model=Qwen3-32B, Reaso...Model=Qwen3-32B, Reasoning Mode=think2026.0550.73967Gemma-4Model=Gemma-4-31B-it,...Model=Gemma-4-31B-it, Reasoning Mode=inline2026.0519821Qwen3Model=Qwen3-32B, Reaso...Model=Qwen3-32B, Reasoning Mode=no_think2026.0512.89179