Autonomous Exploration on ALFWorld, SciWorld, TextCraft Macro-average
12.6Average ECCQwen2.5-7B+GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-7B+GRPOModel Category=Open-Source Models, Training=Task-oriented GRPO2026.05 | 12.6 | 1.2 | |
| Qwen3-4B+GRPOModel Category=Open-Source Models, Training=Task-oriented GRPO2026.05 | 18.8 | 0.8 | |
| Qwen2.5-7BModel Category=Open-Source Models2026.05 | 22.2 | 0.7 | |
| Qwen3-4BModel Category=Open-Source Models2026.05 | 28.5 | 2.2 | |
| LLaMA3.1-8BModel Category=Open-Source Models2026.05 | 30.9 | 1.7 | |
| GPT-4.1Model Category=Closed-Source Models2026.05 | 49.3 | 2 | |
| Claude-Opus-4.5Model Category=Closed-Source Models2026.05 | 89.5 | 8.6 |