Sequential Task Completion on ALFWorld
30.7AccuracyAgent-BRACE
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Agent-BRACEBackbone=Qwen3-4B-Instruct2026.05 | 30.7 | 39.1 | |
| Direct-Action (RL)Training=RL, Backbone=Qwen3-4B-Instruct2026.05 | 27.9 | 19.1 | |
| MEM1Config=Memory-based, Backbone=Qwen3-4B-Instruct2026.05 | 25.7 | 42.9 | |
| Base ModelMode=Inference-only, Backbone=Qwen3-4B-Instruct2026.05 | 24.3 | 20.1 | |
| ReAct (RL)Training=RL, Backbone=Qwen3-4B-Instruct2026.05 | 22.1 | 10.6 | |
| ReActMode=Inference-only, Backbone=Qwen3-4B-Instruct2026.05 | 16.4 | 9.6 |