Inference Latency on Multi-turn Adversarial Defense Latency Benchmark (inference)
4Latency (ms)Llama-Prompt-Guard-2-86M
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama-Prompt-Guard-2-86MHardware=NVIDIA A100, Precision=Quantized FP162026.02 | 4 | |
| Deberta-v3-Prompt-InjectionHardware=NVIDIA A100, Precision=Quantized FP162026.02 | 4 | |
| DeepContextHardware=NVIDIA A100, Precision=Quantized FP162026.02 | 19 | |
| Llama-Guard-4-12BHardware=NVIDIA A100, Precision=Quantized FP16, Serving Engine=vLLM [36]2026.02 | 43 | |
| Qwen3Guard-Gen-8BHardware=NVIDIA A100, Precision=Quantized FP16, Serving Engine=vLLM [36]2026.02 | 64 | |
| Azure Prompt ShieldHardware=NVIDIA A100, Precision=Quantized FP162026.02 | 77 | |
| GCP Model ArmorHardware=NVIDIA A100, Precision=Quantized FP162026.02 | 81 | |
| Granite-Guardian-3.3-8BHardware=NVIDIA A100, Precision=Quantized FP16, Serving Engine=vLLM [36]2026.02 | 125 | |
| AWS Prompt Attack GuardrailsHardware=NVIDIA A100, Precision=Quantized FP162026.02 | 235 | |
| Gpt5-NanoHardware=NVIDIA A100, Precision=Quantized FP162026.02 | 317 |