Medical Diagnosis on DiagnosisArena (test)
31.88Match (LLM-as-a-Judge)GoS
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GoSBackbone=GPT-5.1-2025-11-13, Atomic Reasoning Unit=ReAct, Retrieval Budget=3, Maximum Neuro-symbolic Interaction Iterations=32026.03 | 31.88 | 74.64 | 39.86 | 78.99 | 0.12 | |
| Multi/FoTAgent Architecture=Multi-Agent, Reasoning Topology=FoT, Backbone=GPT-5.1-2025-11-13, Atomic Reasoning Unit=ReAct, Retrieval Budget=32026.03 | 23.19 | 63.04 | 26.09 | 65.94 | 0.73 | |
| Single/FoTAgent Architecture=Single-Agent, Reasoning Topology=FoT, Backbone=GPT-5.1-2025-11-13, Atomic Reasoning Unit=ReAct, Retrieval Budget=52026.03 | 21.74 | 58.7 | 21.01 | 61.59 | 0.32 | |
| Multi/GoTAgent Architecture=Multi-Agent, Reasoning Topology=GoT, Backbone=GPT-5.1-2025-11-13, Atomic Reasoning Unit=ReAct, Retrieval Budget=32026.03 | 21.74 | 52.17 | 23.91 | 55.07 | 0.15 | |
| Single/CoTAgent Architecture=Single-Agent, Reasoning Topology=CoT, Backbone=GPT-5.1-2025-11-13, Atomic Reasoning Unit=ReAct, Retrieval Budget=52026.03 | 21.01 | 47.83 | 24.64 | 48.55 | 0.03 | |
| Single/GoTAgent Architecture=Single-Agent, Reasoning Topology=GoT, Backbone=GPT-5.1-2025-11-13, Atomic Reasoning Unit=ReAct, Retrieval Budget=52026.03 | 21.01 | 50 | 22.46 | 52.9 | 0.07 | |
| Multi/CoTAgent Architecture=Multi-Agent, Reasoning Topology=CoT, Backbone=GPT-5.1-2025-11-13, Atomic Reasoning Unit=ReAct, Retrieval Budget=32026.03 | 21.01 | 49.28 | 23.19 | 50.72 | 0.07 | |
| Multi/ToTAgent Architecture=Multi-Agent, Reasoning Topology=ToT, Backbone=GPT-5.1-2025-11-13, Atomic Reasoning Unit=ReAct, Retrieval Budget=32026.03 | 20.29 | 50.72 | 23.91 | 53.62 | 0.17 | |
| Single/ToTAgent Architecture=Single-Agent, Reasoning Topology=ToT, Backbone=GPT-5.1-2025-11-13, Atomic Reasoning Unit=ReAct, Retrieval Budget=52026.03 | 18.84 | 47.1 | 19.57 | 45.65 | 0.08 |