Embodied Agent on ALFWorld Unseen
90.3Average RewardMACLA
Evaluation Results
| Method | Links | |
|---|---|---|
| MACLARefinement Category=Process Refinement, Backbone=Llama-2-7B2025.12 | 90.3 | |
| Qwen2.5-72BRefinement Category=Process Refinement, Backbone=Qwen2.5-72B, Scale=72B2025.12 | 77.2 | |
| IPRRefinement Category=Process Refinement, Backbone=Llama-2-7B2025.12 | 74.7 | |
| Claude-3.5-SonnetRefinement Category=Process Refinement, Backbone=Claude-3.5-Sonnet, Scale=Proprietary2025.12 | 74.7 | |
| ETORefinement Category=Outcome Refinement, Backbone=Llama-2-7B2025.12 | 72.4 | |
| Step-PPORefinement Category=Process Refinement, Backbone=Llama-2-7B2025.12 | 69.4 | |
| SFTRefinement Category=Outcome Refinement, Backbone=Llama-2-7B2025.12 | 67.2 | |
| RFT-CRRefinement Category=Outcome Refinement, Backbone=Llama-2-7B2025.12 | 66.4 | |
| GPT-4Refinement Category=Prompt-based, Backbone=GPT-42025.12 | 38.1 | |
| RFT-PPORefinement Category=Outcome Refinement, Backbone=Llama-2-7B2025.12 | 29.1 | |
| GPT-3.5-TurboRefinement Category=Prompt-based, Backbone=GPT-3.5-Turbo2025.12 | 10.5 | |
| Llama-2-7BRefinement Category=Prompt-based, Backbone=Llama-2-7B2025.12 | 0 |