Mobility Trajectory Generation on Arizona CA -> AZ Zero-shot transfer
76.8AccuracyGRPO_Qwen
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GRPO_QwenTraining Strategy=GRPO, Backbone Model=Qwen, Multi-agent architecture=true2026.04 | 76.8 | 21.5 | 10.1 | |
| SFT_QwenTraining Strategy=SFT, Backbone Model=Qwen, Multi-agent architecture=true2026.04 | 74.5 | 23.9 | 11.3 | |
| GRPO_QwenTraining Strategy=GRPO, Backbone Model=Qwen, Multi-agent architecture=true2026.04 | 72.1 | 19.1 | 8.6 | |
| GRPO_LLaMATraining Strategy=GRPO, Backbone Model=LLaMA, Multi-agent architecture=true2026.04 | 72 | 26 | 13.1 | |
| SFT_QwenTraining Strategy=SFT, Backbone Model=Qwen, Multi-agent architecture=true2026.04 | 69.9 | 21.4 | 9.7 | |
| SFT_LLaMATraining Strategy=SFT, Backbone Model=LLaMA, Multi-agent architecture=true2026.04 | 68.9 | 25.6 | 15.8 | |
| SFT_CoPBTraining Strategy=SFT, Backbone Model=CoPB, Multi-agent architecture=true2026.04 | 68.2 | 42 | 12.7 | |
| SFT_RAGHomeTraining Strategy=SFT, Backbone Model=RAGHome, Multi-agent architecture=true2026.04 | 67.1 | 32.2 | 18.3 | |
| GRPO_LLaMATraining Strategy=GRPO, Backbone Model=LLaMA, Multi-agent architecture=true2026.04 | 67.1 | 23.3 | 11.8 | |
| SFT_CoPBTraining Strategy=SFT, Backbone Model=CoPB, Multi-agent architecture=true2026.04 | 65.4 | 37.1 | 10.9 | |
| SFT_LLaMATraining Strategy=SFT, Backbone Model=LLaMA, Multi-agent architecture=true2026.04 | 65.3 | 22.8 | 14.1 | |
| SFT_RAGHomeTraining Strategy=SFT, Backbone Model=RAGHome, Multi-agent architecture=true2026.04 | 63.6 | 28.7 | 15.1 |