Diagnosis on MIMIC-IV (test)
91.31Macro F1CAMP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CAMPModel=GPT-5.42026.03 | 91.31 | 75.65 | |
| Single AgentModel=GPT-5.42026.03 | 89.95 | 74.65 | |
| CAMPModel=Llama-3.1-70B2026.03 | 87.5 | 67.1 | |
| Majority VotingModel=Llama-3.1-70B2026.03 | 85.84 | 66.55 | |
| Devil’s AdvocateModel=Gemma-3-27B2026.03 | 85.56 | 65.5 | |
| MedAgentsModel=Gemma-3-27B2026.03 | 85.34 | 65.2 | |
| CAMPModel=Gemma-3-27B2026.03 | 85.1 | 64.2 | |
| Chain-of-ThoughtModel=Gemma-3-27B2026.03 | 83.16 | 56.45 | |
| LLM-as-a-JudgeModel=Llama-3.1-70B2026.03 | 83.13 | 57.4 | |
| Devil’s AdvocateModel=Llama-3.1-70B2026.03 | 83.06 | 57.2 | |
| MedAgentsModel=Llama-3.1-70B2026.03 | 82.77 | 56.7 | |
| LLM-as-a-JudgeModel=Gemma-3-27B2026.03 | 82.22 | 56.15 | |
| CAMPModel=GPT-OSS-20B2026.03 | 82.2 | 63.15 | |
| Single AgentModel=Gemma-3-27B2026.03 | 81.12 | 49.6 | |
| Self-ConsistencyModel=Gemma-3-27B2026.03 | 81.02 | 49.45 | |
| Chain-of-ThoughtModel=Llama-3.1-70B2026.03 | 78.99 | 45.55 | |
| Self-ConsistencyModel=Llama-3.1-70B2026.03 | 78.91 | 45.05 | |
| Single AgentModel=Llama-3.1-70B2026.03 | 78.68 | 44.25 | |
| Majority VotingModel=Gemma-3-27B2026.03 | 78.17 | 58.05 | |
| Chain-of-ThoughtModel=GPT-OSS-20B2026.03 | 76.54 | 60.5 | |
| Self-ConsistencyModel=GPT-OSS-20B2026.03 | 76.38 | 60.75 | |
| LLM-as-a-JudgeModel=GPT-OSS-20B2026.03 | 75.98 | 47.92 | |
| Single AgentModel=GPT-OSS-20B2026.03 | 75.78 | 60.45 | |
| Devil’s AdvocateModel=GPT-OSS-20B2026.03 | 75.56 | 47.47 | |
| MedAgentsModel=GPT-OSS-20B2026.03 | 75.54 | 47.22 | |
| Majority VotingModel=GPT-OSS-20B2026.03 | 74 | 58.6 |