Safety Evaluation on Safe Tasks
66.8JDR-R1AutoGPT
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| AutoGPTAttack Protocol=HI-Traits Attack2024.01 | 66.8 | — | — | 94.9 | 88.1 | |
| AutoGPTAttack Protocol=HI Attack2024.01 | 60.2 | — | — | 94.4 | 58.51 | |
| AutoGenAttack Protocol=HI-Traits Attack2024.01 | 51 | 43.8 | 41.3 | 100 | 81.9 | |
| CamelAttack Protocol=HI-Traits Attack2024.01 | 40.3 | 27 | 28.1 | 98 | 76.61 | |
| AutoGenAttack Protocol=HI Attack2024.01 | 30.6 | 22.9 | 19.9 | 99.5 | 51.08 | |
| MetaGPTAttack Protocol=HI-Traits Attack2024.01 | 2.1 | — | — | 57 | 79.91 | |
| CamelAttack Protocol=HI Attack2024.01 | 2 | 1 | 2.6 | 94.9 | 41.1 | |
| CamelAttack Protocol=w/o Attack2024.01 | 0 | 0 | 0 | 5.6 | 29.99 | |
| AutoGenAttack Protocol=w/o Attack2024.01 | 0 | 0 | 0 | 2 | 32.95 | |
| MetaGPTAttack Protocol=w/o Attack2024.01 | 0 | — | — | 0 | 33.64 | |
| MetaGPTAttack Protocol=HI Attack2024.01 | 0 | — | — | 2.6 | 60.1 | |
| AutoGPTAttack Protocol=w/o Attack2024.01 | 0 | — | — | 0 | 29.3 |