Multi-Agent Path Finding on 3-agent 4x4 (test)
64.67Valid RateQwen3-4B + GRPO + Ours
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-4B + GRPO + OursBackbone=Qwen3-4B, Training=GRPO + Adaptive-weight reward2026.06 | 64.67 | 41.33 | |
| Kimi-K2.52026.06 | 59.33 | 34.67 | |
| Qwen3-4B + GRPO (random)Backbone=Qwen3-4B, Training=GRPO (random)2026.06 | 54 | 40.67 | |
| Grok-4.22026.06 | 50 | 37.33 | |
| GPT-5.42026.06 | 44.67 | 29.33 | |
| Gemini-3.1-Pro2026.06 | 32.67 | 23.33 | |
| Qwen3-4B (base)Backbone=Qwen3-4B2026.06 | 24 | 21.33 |