Language Agent Task on AgentGym All (test)
69.3Success RateAAWM
Evaluation Results
| Method | Links | |
|---|---|---|
| AAWMEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (AAWM), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 69.3 | |
| IWM-SummaryEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (IWM-Summary), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 61.4 | |
| BaseEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (Base), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 61.1 | |
| IWMEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (IWM), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 59.6 | |
| Qwen2.5Evaluation Protocol=Prompting, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 13 |