ResearchBenchmarksConditional-independence (belief sufficiency) testing on Heart Expert-Constructed Bayesian NetworkFollow0.1454CMIGPT-Min0.0643840.0854170.106450.127483Feb 6, 2026Evaluation ResultsMethodMethodLinksCMICMI 95% CI Lower Bound% Log-Loss Improvement (A~p vs A~(p,θ))% Log-Loss Improvement CI Lower Bound (A~p vs A~(p,θ))% Log-Loss Improvement (A~(p,x) vs A~(p,x,θ))% Log-Loss Improvement CI Lower Bound (A~(p,x) vs A~(p,x,θ))GPT-MinModel=GPT-MinModel=GPT-Min2026.020.1454—16.37—13.05—GPT-HighModel=GPT-HighModel=GPT-High2026.020.0753—4.23—3.82—LlamaModel=LlamaModel=Llama2026.020.0718—2.98—1.02—DeepSeekModel=DeepSeekModel=DeepSeek2026.020.0675—4.52—2.03—