Autonomous Exploration on ALFWorld
11.8StepsQwen2.5-7B+GRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen2.5-7B+GRPOModel Category=Open-Source Models, Training=Task-oriented GRPO2026.05 | 11.8 | 11.2 | 1.3 | |
| Qwen3-4BModel Category=Open-Source Models2026.05 | 19.2 | 35.5 | 2.2 | |
| LLaMA3.1-8BModel Category=Open-Source Models2026.05 | 22.5 | 36.8 | 1.6 | |
| GPT-4.1Model Category=Closed-Source Models2026.05 | 24.8 | 52.3 | 1.9 | |
| Qwen3-4B+GRPOModel Category=Open-Source Models, Training=Task-oriented GRPO2026.05 | 35.5 | 32.8 | 0.5 | |
| Qwen2.5-7BModel Category=Open-Source Models2026.05 | 36.8 | 19.3 | 0.3 | |
| Claude-Opus-4.5Model Category=Closed-Source Models2026.05 | 61.9 | 96.8 | 6.3 |