Safety Dialogue Evaluation on SafeDialBench (Normalized Score, Discriminability)
61.33Normalized ScoreQwen3-Max-Thinking
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-Max-Thinkingformatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 61.33 | 18 | |
| DeepSeek-V3.2formatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 53.95 | 18 | |
| Kimi-K2.5formatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 49.86 | 18 | |
| MiniMax-M2.5formatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 46.85 | 18 | |
| GLM-5formatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 34.02 | 18 |