ResearchBenchmarksConditional-independence (belief sufficiency) testing on CryFollow0.4223CMILlama0.1645880.2314940.29840.365306Feb 6, 2026Evaluation ResultsMethodMethodLinksCMICMI 95% CILogLoss Imp. (CB: A~p vs A~(p,θ))LogLoss Imp. CI (CB: A~p vs A~(p,θ))LogLoss Imp. (CB: A~(p,x) vs A~(p,x,θ))LogLoss Imp. CI (CB: A~(p,x) vs A~(p,x,θ))LlamaModel=LlamaModel=Llama2026.020.4223—0.56—2.83—GPT-MinModel=GPT-MinModel=GPT-Min2026.020.2232—14.84—4.88—GPT-HighModel=GPT-HighModel=GPT-High2026.020.1901—11.52—9.25—DeepSeekModel=DeepSeekModel=DeepSeek2026.020.1745—0.88—2.66—