Medical Knowledge on HealthBench (Pass@1)
92.82Pass@1GPT-5.2-chat (teacher)
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5.2-chat (teacher)2026.05 | 92.82 | |
| ROPDThinking Mode=Thinking2026.05 | 86.87 | |
| OVDThinking Mode=Thinking2026.05 | 85.98 | |
| GADThinking Mode=Thinking2026.05 | 85.7 | |
| T-JudgeThinking Mode=Thinking2026.05 | 85.58 | |
| Qwen3-4B (student)Thinking Mode=Thinking2026.05 | 85.3 | |
| ROPDThinking Mode=Non-Thinking2026.05 | 84.92 | |
| T-JudgeThinking Mode=Non-Thinking2026.05 | 84.52 | |
| OVDThinking Mode=Non-Thinking2026.05 | 83.68 | |
| GADThinking Mode=Non-Thinking2026.05 | 83.57 | |
| Qwen3-4B (student)Thinking Mode=Non-Thinking2026.05 | 83.32 |