Health Dialogue on HealthBench
44.92AccuracyOfficial Instruct Model
Evaluation Results
| Method | Links | |
|---|---|---|
| Official Instruct ModelEvaluation Category=Official Instruct Model2026.05 | 44.92 | |
| GPT-5.4 (High)Evaluation Category=Agent-Post-Trained, Base Model=Qwen3-1.7B2026.05 | 29.39 | |
| GLM-4.7 & ANDESEvaluation Category=Proposed Method Comparison, Base Model=Qwen3-1.7B2026.05 | 25.87 | |
| GLM-4.7 (Scaffold-only)Evaluation Category=Proposed Method Comparison, Base Model=Qwen3-1.7B2026.05 | 16.74 | |
| Opus-4.7 (xHigh)Evaluation Category=Agent-Post-Trained, Base Model=Qwen3-1.7B2026.05 | 16.23 | |
| Gemini-3.1-ProEvaluation Category=Agent-Post-Trained, Base Model=Qwen3-1.7B2026.05 | 10.93 | |
| Opus-4.6 (1M)Evaluation Category=Agent-Post-Trained, Base Model=Qwen3-1.7B2026.05 | 9.73 | |
| GPT-5.2Evaluation Category=Agent-Post-Trained, Base Model=Qwen3-1.7B2026.05 | 9.33 | |
| Opus-4.6Evaluation Category=Agent-Post-Trained, Base Model=Qwen3-1.7B2026.05 | 8.58 | |
| MiniMax-M2.5Evaluation Category=Agent-Post-Trained, Base Model=Qwen3-1.7B2026.05 | 7.66 | |
| Base Model (Qwen3-1.7B)Evaluation Category=Zero-Shot2026.05 | 7.54 | |
| MiniMax-M2.1Evaluation Category=Agent-Post-Trained, Base Model=Qwen3-1.7B2026.05 | 7.54 | |
| Qwen3-MaxEvaluation Category=Agent-Post-Trained, Base Model=Qwen3-1.7B2026.05 | 7.54 | |
| Kimi-K2-ThinkingEvaluation Category=Agent-Post-Trained, Base Model=Qwen3-1.7B2026.05 | 7.54 | |
| GPT-5.1-Codex-MaxEvaluation Category=Agent-Post-Trained, Base Model=Qwen3-1.7B2026.05 | 7.54 | |
| GLM-4.7 (OpenCode)Evaluation Category=Proposed Method Comparison, Base Model=Qwen3-1.7B2026.05 | 7.54 | |
| Sonnet-4.5Evaluation Category=Agent-Post-Trained, Base Model=Qwen3-1.7B2026.05 | 0 |