Safety Evaluation on Dangerous Tasks
7,410JDR R1AutoGPT
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| AutoGPTAttack Protocol=HI Attack2024.01 | 7,410 | — | — | 0.97 | 57.38 | |
| AutoGPTAttack Protocol=HI-Traits Attack2024.01 | 7,360 | — | — | 0.953 | 87.77 | |
| MetaGPTAttack Protocol=HI-Traits Attack2024.01 | 3,340 | — | — | 0.808 | 79.25 | |
| CamelAttack Protocol=HI-Traits Attack2024.01 | 3,230 | 2,650 | 2,440 | 0.968 | 67.99 | |
| AutoGenAttack Protocol=HI Attack2024.01 | 2,550 | 470 | 420 | 0.769 | 32.12 | |
| MetaGPTAttack Protocol=HI Attack2024.01 | 1,630 | — | — | 0.517 | 60.99 | |
| AutoGenAttack Protocol=HI-Traits Attack2024.01 | 1,360 | 940 | 750 | 0.977 | 79.19 | |
| CamelAttack Protocol=HI Attack2024.01 | 550 | 200 | 400 | 0.852 | 33.26 | |
| AutoGenAttack Protocol=w/o Attack2024.01 | 250 | 100 | 50 | 0.312 | 31.11 | |
| MetaGPTAttack Protocol=w/o Attack2024.01 | 230 | — | — | 0.147 | 36.56 | |
| CamelAttack Protocol=w/o Attack2024.01 | 30 | 50 | 30 | 0.16 | 29.64 | |
| AutoGPTAttack Protocol=w/o Attack2024.01 | 20 | — | — | 0.036 | 26.41 |