Safety Evaluation on JailbreakBench
0Harmful RateSafeReAct
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SafeReActModel=R1-8B2026.03 | 0 | — | — | |
| SafeReActModel=OT-7B2026.03 | 0 | — | — | |
| SafeReActModel=R1-14B2026.03 | 0 | — | — | |
| SafeReActModel=R1-7B2026.03 | 1 | — | — | |
| Circuit-BreakerModel=R1-8B2026.03 | 2 | — | — | |
| SafeChainModel=R1-14B2026.03 | 7 | — | — | |
| SafeChainModel=R1-7B2026.03 | 8 | — | — | |
| SafeChainModel=OT-7B2026.03 | 9 | — | — | |
| Circuit-BreakerModel=R1-14B2026.03 | 17 | — | — | |
| OriginalModel=R1-14B2026.03 | 23 | — | — | |
| SafeChainModel=R1-8B2026.03 | 27 | — | — | |
| OriginalModel=R1-8B2026.03 | 33 | — | — | |
| Circuit-BreakerModel=OT-7B2026.03 | 41 | — | — | |
| OriginalModel=OT-7B2026.03 | 43 | — | — | |
| OriginalModel=R1-7B2026.03 | 45 | — | — | |
| Circuit-BreakerModel=R1-7B2026.03 | 47 | — | — | |
| ActorAttackToken Cost=8K2026.03 | — | — | 37.5 | |
| MDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=China-centric, Top-k Layers=4, Coeff=-0.5, Reposition=false2025.12 | — | 81 | — | |
| MDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=Extended, Top-k Layers=4, Coeff=-1, Reposition=false2025.12 | — | 92 | — | |
| OriginalBackbone=Llama-3-8B-UltraMedical2026.03 | — | 66 | — | |
| Qwen3-Next-4B-InstructN. Params=4B, MoE=false, Reasoning=false2025.12 | — | 99 | — | |
| Qwen3-Next-4B-ThinkingN. Params=4B, MoE=false, Reasoning=true2025.12 | — | 98 | — | |
| Qwen3-Next-80B-A3B-ThinkingN. Params=80B, MoE=true, Reasoning=true2025.12 | — | 99 | — | |
| RMDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=China-centric, Top-k Layers=4, Coeff=-0.75, Reposition=false2025.12 | — | 82 | — | |
| RMDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=Extended, Top-k Layers=4, Coeff=-2, Reposition=false2025.12 | — | 86.87 | — | |
| SafeReActBackbone=Llama-3-8B-UltraMedical2026.03 | — | 6 | — | |
| STARToken Cost=37K2026.03 | — | — | 94 | |
| WMDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=China-centric, Top-k Layers=8, Coeff=-0.25, Reposition=false2025.12 | — | 91 | — | |
| WMDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=Extended, Top-k Layers=8, Coeff=-0.25, Reposition=false2025.12 | — | 84 | — | |
| WRMDBase Model=Qwen3-Next-4B-Instruct, N. Params=4B, MoE=false, Reasoning=false, Train Dataset=Extended, Top-k Layers=4, Coeff=-0.5, Reposition=false2025.12 | — | 55 | — | |
| WRMDBase Model=Qwen3-Next-4B-Thinking, N. Params=4B, MoE=false, Reasoning=true, Train Dataset=Extended, Top-k Layers=2, Coeff=-2, Reposition=false2025.12 | — | 78 | — | |
| WRMDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=China-centric, Top-k Layers=8, Coeff=-0.25, Reposition=false2025.12 | — | 90 | — | |
| WRMDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=Extended, Top-k Layers=16, Coeff=-0.15, Reposition=false2025.12 | — | 99 | — | |
| X-TeamingToken Cost=30K2026.03 | — | — | 85.5 |