Evidence-grounded diagnostic reasoning on CXReasonDial Dynamic User Simulator
99.9Coverage (Cov)CXReasonAgent
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| CXReasonAgentBackbone=Gemini-3-Flash2026.02 | 99.9 | 98 | 98.5 | 99.9 | 0.1 | 93.3 | 75.7 | |
| CXReasonAgentBackbone=GPT-5 mini2026.02 | 99.9 | 99.9 | 98.8 | 99.8 | 0.2 | 98.4 | 85.8 | |
| CXReasonAgentBackbone=Llama 3.3-70B2026.02 | 99.9 | 98.8 | 98.3 | 99.7 | 0.3 | 96.1 | 79.9 | |
| CXReasonAgentBackbone=Qwen3-32B2026.02 | 99.9 | 96.5 | 97.4 | 98.7 | 1.3 | 92.4 | 67.8 | |
| CXReasonAgentBackbone=Qwen3-8B2026.02 | 99.9 | 83 | 84.7 | 96.8 | 3.2 | 76.4 | 29.4 | |
| CXReasonAgentBackbone=Qwen3-4B2026.02 | 99.8 | 88.7 | 89.6 | 97.3 | 2.7 | 81.7 | 38.5 | |
| MedGemma 27BFramework=LVLM Baseline2026.02 | 98.7 | — | — | 44.9 | 53.8 | 34.8 | 5.1 | |
| Gemini-3-FlashFramework=LVLM Baseline2026.02 | 98.5 | — | — | 46.3 | 52.3 | 33.8 | 9.1 | |
| Pixtral-LargeFramework=LVLM Baseline2026.02 | 98.5 | — | — | 48.2 | 50.3 | 35.5 | 7.7 |