Embodied Agent Performance on ALFWorld Seen
87.2Average RewardMACLA
Evaluation Results
| Method | Links | |
|---|---|---|
| MACLARefinement Category=Process Refinement, Backbone=Llama-2-7B2025.12 | 87.2 | |
| Qwen2.5-72BRefinement Category=Process Refinement, Backbone=Qwen2.5-72B, Scale=72B2025.12 | 85.7 | |
| Claude-3.5-SonnetRefinement Category=Process Refinement, Backbone=Claude-3.5-Sonnet, Scale=Proprietary2025.12 | 82.5 | |
| IPRRefinement Category=Process Refinement, Backbone=Llama-2-7B2025.12 | 70.3 | |
| ETORefinement Category=Outcome Refinement, Backbone=Llama-2-7B2025.12 | 68.6 | |
| Step-PPORefinement Category=Process Refinement, Backbone=Llama-2-7B2025.12 | 65.7 | |
| RFT-CRRefinement Category=Outcome Refinement, Backbone=Llama-2-7B2025.12 | 62.9 | |
| SFTRefinement Category=Outcome Refinement, Backbone=Llama-2-7B2025.12 | 60 | |
| GPT-4Refinement Category=Prompt-based, Backbone=GPT-42025.12 | 42.9 | |
| RFT-PPORefinement Category=Outcome Refinement, Backbone=Llama-2-7B2025.12 | 22.1 | |
| GPT-3.5-TurboRefinement Category=Prompt-based, Backbone=GPT-3.5-Turbo2025.12 | 7.9 | |
| Llama-2-7BRefinement Category=Prompt-based, Backbone=Llama-2-7B2025.12 | 0 |