Multi-Agent Path Finding on MAPF-FrozenLake 4-agent 7x7
33.33Valid RateQwen3-4B + GRPO + LLM-as-Environment-Engineer
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-4B + GRPO + LLM-as-Environment-EngineerBackbone=Qwen3-4B, Training=GRPO, Environment Design=Ours2026.06 | 33.33 | 24.67 | |
| Kimi-K2.52026.06 | 28 | 22.67 | |
| Qwen3-4B + GRPO (random)Backbone=Qwen3-4B, Training=GRPO, Config=single randomly sampled Round-02026.06 | 26.67 | 15.33 | |
| Grok-4.22026.06 | 25.33 | 16.67 | |
| Gemini-3.1-Pro2026.06 | 16.67 | 12.67 | |
| GPT-5.42026.06 | 14 | 9.33 | |
| Qwen3-4B (base)Backbone=Qwen3-4B, Status=untrained2026.06 | 4 | 3.33 |