Medical Reasoning Accuracy on DDXPlus
83.37Accuracy (DDXPlus)DMoA
Evaluation Results
| Method | Links | |
|---|---|---|
| DMoABackbone=gpt-oss-120b, Evaluation Paradigm=few-shot2026.05 | 83.37 | |
| SafeSieveBackbone=gpt-oss-120b2026.05 | 77.94 | |
| MDAgentsBase Model=GPT-4o2025.08 | 77.9 | |
| SpecReasonBackbone=gpt-oss-120b2026.05 | 76.58 | |
| G-DesignerBackbone=gpt-oss-120b, Evaluation Paradigm=few-shot2026.05 | 76.42 | |
| ARG-DesignerBackbone=gpt-oss-120b, Evaluation Paradigm=few-shot2026.05 | 76.03 | |
| GPTSwarmBackbone=gpt-oss-120b2026.05 | 75.57 | |
| STEERBackbone=gpt-oss-120b2026.05 | 75.2 | |
| TMA-AllComponBase Model=GPT-4o2025.08 | 74.9 | |
| AFlowBackbone=gpt-oss-120b2026.05 | 74.25 | |
| Single-Agent BestBase Model=Gemma-3-4B2025.08 | 72.1 | |
| MoABackbone=gpt-oss-120b2026.05 | 71.85 | |
| AutoGenBackbone=gpt-oss-120b2026.05 | 71.83 | |
| LLM-DebateBackbone=gpt-oss-120b2026.05 | 71.33 | |
| Random GraphBackbone=gpt-oss-120b2026.05 | 70.44 | |
| Complete GraphBackbone=gpt-oss-120b2026.05 | 70.35 | |
| TMA-AllComponBase Model=MedGemma-4B2025.08 | 70.2 | |
| TreeBackbone=gpt-oss-120b2026.05 | 69.25 | |
| MedAgentsBase Model=Gemma-3-4B2025.08 | 69.1 | |
| StarBackbone=gpt-oss-120b2026.05 | 68.25 | |
| ReConcileBase Model=GPT-4o2025.08 | 68 | |
| TMA-AllComponBase Model=Gemma-3-4B2025.08 | 67.3 | |
| MedAgentsBase Model=GPT-4o2025.08 | 66.6 | |
| SCBackbone=gpt-oss-120b2026.05 | 66.43 | |
| DyLANBase Model=Gemma-3-4B2025.08 | 65.6 | |
| TMA-AllComponBase Model=Gemma-3-4B2025.08 | 65.3 | |
| ChainBackbone=gpt-oss-120b2026.05 | 65.28 | |
| CoTBackbone=gpt-oss-120b2026.05 | 64.22 | |
| MedAgentsBase Model=Gemma-3-4B2025.08 | 61 | |
| DyLanBase Model=Gemma-3-4B2025.08 | 60 | |
| ReConcileBase Model=Gemma-3-4B2025.08 | 58 | |
| VanillaBackbone=gpt-oss-120b2026.05 | 56.4 | |
| DyLANBase Model=GPT-4o2025.08 | 56 | |
| ReConcileBase Model=Gemma-3-4B2025.08 | 54 | |
| MDAgentsBase Model=Gemma-3-4B2025.08 | 52.6 | |
| MDAgentsBase Model=Gemma-3-4B2025.08 | 49.3 |