Jailbreak Defense on WordGame
14.65ASRGuardReasoner-1B
Evaluation Results
| Method | Links | |
|---|---|---|
| GuardReasoner-1BGuardrail Type=Generative, Protected LLM=GPT-4o2026.06 | 14.65 | |
| YuFeng-XGuard-0.6B Prompt+ResponseGuardrail Type=Generative, Input Context=Prompt+Response, Protected LLM=GPT-4o2026.06 | 22.29 | |
| w/o Future-Aware ReasoningGuardrail Type=Stream, Protected LLM=GPT-4o, Future-Aware Reasoning=false, Safety-Aligned Optimization=true2026.06 | 25.48 | |
| FreoStreamGuardrail Type=Stream, Protected LLM=GPT-4o, Future-Aware Reasoning=true, Safety-Aligned Optimization=true2026.06 | 27.39 | |
| YuFeng-XGuard-0.6B Prompt OnlyGuardrail Type=Generative, Input Context=Prompt Only, Protected LLM=GPT-4o2026.06 | 35.03 | |
| Qwen-Stream-8BGuardrail Type=Stream, Protected LLM=GPT-4o2026.06 | 35.03 | |
| w/o Safety-Aligned OptimizationGuardrail Type=Stream, Protected LLM=GPT-4o, Future-Aware Reasoning=true, Safety-Aligned Optimization=false2026.06 | 35.03 | |
| Qwen-Stream-0.6BGuardrail Type=Stream, Protected LLM=GPT-4o2026.06 | 36.31 | |
| Nemotron-4BGuardrail Type=Generative, Protected LLM=GPT-4o2026.06 | 50.96 | |
| Qwen-Gen-0.6B Prompt OnlyGuardrail Type=Generative, Input Context=Prompt Only, Protected LLM=GPT-4o2026.06 | 68.79 | |
| Qwen-Gen-0.6B Prompt+ResponseGuardrail Type=Generative, Input Context=Prompt+Response, Protected LLM=GPT-4o2026.06 | 73.25 |