Over-Refusal Evaluation on OverBench
5.59ORRw/o Safety-Aligned Optimization
Evaluation Results
| Method | Links | |
|---|---|---|
| w/o Safety-Aligned OptimizationGuardrail Type=Stream, Protected LLM=GPT-4o, Future-Aware Reasoning=true, Safety-Aligned Optimization=false2026.06 | 5.59 | |
| FreoStreamGuardrail Type=Stream, Protected LLM=GPT-4o, Future-Aware Reasoning=true, Safety-Aligned Optimization=true2026.06 | 6.64 | |
| Qwen-Stream-8BGuardrail Type=Stream, Protected LLM=GPT-4o2026.06 | 10.16 | |
| YuFeng-XGuard-0.6B Prompt+ResponseGuardrail Type=Generative, Input Context=Prompt+Response, Protected LLM=GPT-4o2026.06 | 12.69 | |
| GuardReasoner-1BGuardrail Type=Generative, Protected LLM=GPT-4o2026.06 | 14.5 | |
| Qwen-Gen-0.6B Prompt OnlyGuardrail Type=Generative, Input Context=Prompt Only, Protected LLM=GPT-4o2026.06 | 15.86 | |
| Qwen-Gen-0.6B Prompt+ResponseGuardrail Type=Generative, Input Context=Prompt+Response, Protected LLM=GPT-4o2026.06 | 16.28 | |
| YuFeng-XGuard-0.6B Prompt OnlyGuardrail Type=Generative, Input Context=Prompt Only, Protected LLM=GPT-4o2026.06 | 26.17 | |
| Nemotron-4BGuardrail Type=Generative, Protected LLM=GPT-4o2026.06 | 29.2 | |
| w/o Future-Aware ReasoningGuardrail Type=Stream, Protected LLM=GPT-4o, Future-Aware Reasoning=false, Safety-Aligned Optimization=true2026.06 | 30.99 | |
| Qwen-Stream-0.6BGuardrail Type=Stream, Protected LLM=GPT-4o2026.06 | 31.38 |