Medical Agentic Reasoning on MedAgentBench
87AccuracyStatic Workflow
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Static WorkflowWorkflow Type=Static, LLM Model=DeepSeek-V3.12026.05 | 87 | 0.64 | |
| Dynamic Workflow (ReAct)Workflow Type=Dynamic, LLM Model=DeepSeek-V3.12026.05 | 69 | 0.65 | |
| Nemotron-Terminal-32BTrain Size=264K, Method=SFT, Backbone=Qwen3-32B2026.06 | 62.6 | — | |
| OpenThinkerAgent-32BTrain Size=100K, Method=SFT, Backbone=Qwen3-32B2026.06 | 47.8 | — | |
| SWE-Lego-Qwen3-32BTrain Size=18K, Method=SFT, Backbone=Qwen3-32B2026.06 | 36.2 | — | |
| SA-SWE-32BTrain Size=4.5K, Method=RL, Backbone=Qwen3-32B2026.06 | 15.8 | — | |
| SERA-32BTrain Size=25K, Method=SFT, Backbone=Qwen3-32B2026.06 | 15.6 | — | |
| DeepSWE-PreviewTrain Size=4.5K, Method=RL, Backbone=Qwen3-32B2026.06 | 8.7 | — | |
| Qwen3-32BTrain Size=N/A, Method=N/A, Backbone=Qwen3-32B2026.06 | 6.8 | — | |
| Zero-shot (Default Imp.)Workflow Type=Zero-shot, LLM Model=DeepSeek-V3.12026.05 | 0 | 0.22 |