Malicious AI Agent Skill Detection on 400 labeled skills (89 malicious, 311 benign)
100PrecisionSkillSieve L1 + Single prompt
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SkillSieve L1 + Single promptLayer 1=L1 triage, Layer 2=Single prompt2026.04 | 100 | 59.6 | 74.6 | 91 | 0 | |
| SkillSieve L1 + SSDLayer 1=L1 triage, Layer 2=Structured Semantic Decomposition (SSD)2026.04 | 75.2 | 85.4 | 80 | 90.5 | 8 | |
| SkillSieve L1Layer=L1 triage2026.04 | 58.3 | 98.9 | 73.3 | 84 | 20.3 | |
| ClawVet2026.04 | 32.9 | 58.4 | 42.1 | 64.2 | 34.1 |