Clinical Reasoning Quality Evaluation on P12 (200 randomly sampled cases)
3.429Interpretive Summary Score (I)TRIAGE
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| TRIAGEReasoning Type=Dialectical, Supervision=Dialectical reasoning supervision, Model Type=Small open-source LLM2026.06 | 3.429 | 1.218 | 1.196 | 1.898 | 7.744 | |
| STraTS + IG + GPT InterpretationBase Model=STraTS, XAI Method=Integrated Gradients (IG), Interpreter=GPT-5.12026.06 | 2.526 | 1.234 | 1.101 | 1.609 | 6.474 |