Language Agent Task on AgentGym SciWorld (test)
91.2Success RateAAWM
Evaluation Results
| Method | Links | |
|---|---|---|
| AAWMEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (AAWM), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 91.2 | |
| IWM-SummaryEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (IWM-Summary), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 84.2 | |
| IWMEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (IWM), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 79.8 | |
| BaseEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (Base), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 70.2 | |
| Qwen2.5Evaluation Protocol=Prompting, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 11.7 |