Language Agent Task on AgentGym ALFWorld (test)
36Success RateAAWM
Evaluation Results
| Method | Links | |
|---|---|---|
| AAWMEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (AAWM), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 36 | |
| BaseEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (Base), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 33.3 | |
| IWMEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (IWM), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 30.2 | |
| IWM-SummaryEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (IWM-Summary), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 20 | |
| Qwen2.5Evaluation Protocol=Prompting, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 3.5 |