Language Agent Task on TextCraft
100Success Rate (SR)Kintsugi
Evaluation Results
| Method | Links | |
|---|---|---|
| Kintsugi2026.05 | 100 | |
| LLMKnowledge Base=tools2026.05 | 97 | |
| Dual Memory2026.05 | 94 | |
| ExpeL2026.05 | 88 | |
| ADaPT2026.05 | 77 | |
| Reflexion2026.05 | 69 | |
| StateAct2026.05 | 68 | |
| WALL-E 2.02026.05 | 66 | |
| AWM2026.05 | 66 | |
| ReAct2026.05 | 62 | |
| LLMKnowledge Base=prompt2026.05 | 55 | |
| LLMKnowledge Base=None2026.05 | 53 | |
| AAWMEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (AAWM), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 35.7 | |
| IWM-SummaryEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (IWM-Summary), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 32.3 | |
| BaseEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (Base), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 31.7 | |
| IWMEvaluation Protocol=Imitation Learning, Training Initialization=World Modeling (IWM), Trajectory Mixture=AgentTraj-L, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 31.3 | |
| Qwen2.5Evaluation Protocol=Prompting, Base Model=Qwen2.5-1.5B-Instruct2026.06 | 18.3 |