Medical and Health Knowledge on HealthBench
37.2AccuracyGLM-4.7 & ANDES (Ours)
Evaluation Results
| Method | Links | |
|---|---|---|
| GLM-4.7 & ANDES (Ours)Protocol=Proposed Method, Backbone=SmolLM3-3B2026.05 | 37.2 | |
| Official Instruct ModelProtocol=Official Instruct, Backbone=SmolLM3-3B2026.05 | 29.58 | |
| GPT-5.2Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 21.92 | |
| Opus-4.6 (1M)Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 21.12 | |
| Opus-4.6Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 18.81 | |
| GPT-5.4 (High)Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 18.64 | |
| Gemini-3.1-ProProtocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 18.45 | |
| Opus-4.7 (xHigh)Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 16.53 | |
| GLM-4.7 (Scaffold-only)Protocol=Proposed Method, Backbone=SmolLM3-3B2026.05 | 7.38 | |
| Base Model (SmolLM3-3B)Protocol=Zero-Shot, Backbone=SmolLM3-3B2026.05 | 0 | |
| Sonnet-4.5Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 0 | |
| Qwen3-MaxProtocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 0 | |
| Kimi-K2-ThinkingProtocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 0 | |
| MiniMax-M2.1Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 0 | |
| GPT-5.1-Codex-MaxProtocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 0 | |
| MiniMax-M2.5Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 0 | |
| GLM-4.7 (OpenCode)Protocol=Proposed Method, Backbone=SmolLM3-3B2026.05 | 0 |