Over-Refusal Evaluation on MorBench
1.47ORRFreoStream
Evaluation Results
| Method | Links | |
|---|---|---|
| FreoStreamGuardrail Type=Stream, Protected LLM=GPT-4o, Future-Aware Reasoning=true, Safety-Aligned Optimization=true2026.06 | 1.47 | |
| w/o Safety-Aligned OptimizationGuardrail Type=Stream, Protected LLM=GPT-4o, Future-Aware Reasoning=true, Safety-Aligned Optimization=false2026.06 | 1.47 | |
| Nemotron-4BGuardrail Type=Generative, Protected LLM=GPT-4o2026.06 | 1.89 | |
| Qwen-Stream-8BGuardrail Type=Stream, Protected LLM=GPT-4o2026.06 | 1.99 | |
| YuFeng-XGuard-0.6B Prompt OnlyGuardrail Type=Generative, Input Context=Prompt Only, Protected LLM=GPT-4o2026.06 | 2.73 | |
| GuardReasoner-1BGuardrail Type=Generative, Protected LLM=GPT-4o2026.06 | 2.73 | |
| YuFeng-XGuard-0.6B Prompt+ResponseGuardrail Type=Generative, Input Context=Prompt+Response, Protected LLM=GPT-4o2026.06 | 4.1 | |
| Qwen-Gen-0.6B Prompt+ResponseGuardrail Type=Generative, Input Context=Prompt+Response, Protected LLM=GPT-4o2026.06 | 6.72 | |
| Qwen-Stream-0.6BGuardrail Type=Stream, Protected LLM=GPT-4o2026.06 | 14.6 | |
| w/o Future-Aware ReasoningGuardrail Type=Stream, Protected LLM=GPT-4o, Future-Aware Reasoning=false, Safety-Aligned Optimization=true2026.06 | 14.92 | |
| Qwen-Gen-0.6B Prompt OnlyGuardrail Type=Generative, Input Context=Prompt Only, Protected LLM=GPT-4o2026.06 | 20.27 |