Brief Hospital Course (BHC) Generation on MIMIC-IV (test)
6.02Reasoning ScoreLLM-as-a-Judge
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LLM-as-a-JudgeModel=GPT-OSS-20B2026.03 | 6.02 | 6.25 | 6.34 | |
| Devil’s AdvocateModel=GPT-OSS-20B2026.03 | 6 | 6.37 | 6.3 | |
| MedAgentsModel=GPT-OSS-20B2026.03 | 5.87 | 6.28 | 6.26 | |
| Majority VotingModel=Gemma-3-27B2026.03 | 5.78 | 6 | 5.97 | |
| MedAgentsModel=Gemma-3-27B2026.03 | 5.14 | 5.05 | 5.08 | |
| LLM-as-a-JudgeModel=Gemma-3-27B2026.03 | 4.68 | 4.68 | 4.76 | |
| Devil’s AdvocateModel=Llama-3.1-70B2026.03 | 4.49 | 4.65 | 4.8 | |
| Devil’s AdvocateModel=Gemma-3-27B2026.03 | 4.49 | 4.24 | 4.19 | |
| Self-ConsistencyModel=Gemma-3-27B2026.03 | 4.3 | 4.51 | 4.43 | |
| Chain-of-ThoughtModel=Gemma-3-27B2026.03 | 4.22 | 4.24 | 4.16 | |
| Single AgentModel=Gemma-3-27B2026.03 | 4.11 | 4.3 | 4.3 | |
| MedAgentsModel=Llama-3.1-70B2026.03 | 4.08 | 4.18 | 4.2 | |
| LLM-as-a-JudgeModel=Llama-3.1-70B2026.03 | 4.02 | 4.16 | 4.22 | |
| Majority VotingModel=GPT-OSS-20B2026.03 | 3.93 | 3.75 | 3.81 | |
| Self-ConsistencyModel=Llama-3.1-70B2026.03 | 3.78 | 4.06 | 4.18 | |
| Chain-of-ThoughtModel=GPT-OSS-20B2026.03 | 3.63 | 3.44 | 3.43 | |
| CAMPModel=GPT-OSS-20B2026.03 | 3.55 | 3.2 | 3.24 | |
| Self-ConsistencyModel=GPT-OSS-20B2026.03 | 3.52 | 3.33 | 3.28 | |
| Single AgentModel=GPT-OSS-20B2026.03 | 3.48 | 3.38 | 3.34 | |
| Chain-of-ThoughtModel=Llama-3.1-70B2026.03 | 3.47 | 3.8 | 3.92 | |
| Majority VotingModel=Llama-3.1-70B2026.03 | 3.43 | 3.53 | 3.55 | |
| CAMPModel=Gemma-3-27B2026.03 | 3.3 | 2.97 | 3.11 | |
| Single AgentModel=Llama-3.1-70B2026.03 | 3.24 | 3.61 | 3.67 | |
| CAMPModel=Llama-3.1-70B2026.03 | 2.49 | 2.78 | 2.73 | |
| Single AgentModel=GPT-5.42026.03 | 1.7 | 1.7 | 1.8 | |
| CAMPModel=GPT-5.42026.03 | 1.3 | 1.3 | 1.2 |