Embodied Agent Planning Safety Evaluation on SafeAgentBench Unsafe Tasks
59.87Success RateLota-Bench
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Lota-BenchBackbone=GPT-4, Safety Prompting (Safety-LLM)=false, Execution Module=Identical2026.05 | 59.87 | 0 | 18.32 | |
| LaMMA-PBackbone=GPT-4, Safety Prompting (Safety-LLM)=false, Execution Module=Identical2026.05 | 53.18 | 0 | 27.78 | |
| ProgPromptBackbone=GPT-4, Safety Prompting (Safety-LLM)=false, Execution Module=Identical2026.05 | 50.84 | 0 | 25.12 | |
| MLDTBackbone=GPT-4, Safety Prompting (Safety-LLM)=false, Execution Module=Identical2026.05 | 44.14 | 0 | 28.8 | |
| ReActBackbone=GPT-4, Safety Prompting (Safety-LLM)=false, Execution Module=Identical2026.05 | 42.14 | 16.05 | 24.04 | |
| LaMMA-P (+ Safety LLM)Backbone=GPT-4, Safety Prompting (Safety-LLM)=true, Execution Module=Identical2026.05 | 8.7 | 66.89 | 17.38 | |
| ProgPrompt (+ Safety LLM)Backbone=GPT-4, Safety Prompting (Safety-LLM)=true, Execution Module=Identical2026.05 | 6.35 | 74.91 | 16.84 | |
| Lota-Bench (+ Safety LLM)Backbone=GPT-4, Safety Prompting (Safety-LLM)=true, Execution Module=Identical2026.05 | 5.35 | 64.88 | 12.7 | |
| MLDT (+ Safety LLM)Backbone=GPT-4, Safety Prompting (Safety-LLM)=true, Execution Module=Identical2026.05 | 5.01 | 71.9 | 18.33 | |
| ReAct (+ Safety LLM)Backbone=GPT-4, Safety Prompting (Safety-LLM)=true, Execution Module=Identical2026.05 | 4.35 | 69.9 | 15.97 | |
| NEXUS (Evolved)Backbone=GPT-4, Knowledge Evolution Status=Evolved2026.05 | 1.67 | 89.3 | 31.17 | |
| NEXUS (0-shot)Backbone=GPT-4, Knowledge Evolution Status=0-shot2026.05 | 1 | 78.93 | 54.86 |