Sequential Decision Making on ALFWorld (post-training evaluation)
43.9Rollout LengthStarting policy
Evaluation Results
| Method | Links | |
|---|---|---|
| Starting policyBackbone=Qwen2.5-7B-Instruct2026.06 | 43.9 | |
| GRPOBackbone=Qwen2.5-7B-Instruct, Training Protocol=GRPO2026.06 | 24.45 | |
| TRIAGEBackbone=Qwen2.5-7B-Instruct, Training Protocol=TRIAGE2026.06 | 21.9 |