Multi-Agent Reinforcement Learning training efficiency on Merchant Assistant (MA) (train)
126.1E2E Time (s)FlexMARL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FlexMARLBackbone=Qwen2.5-14B, Cluster=48-node, NPU per node=162026.02 | 126.1 | 7.3 | 910.2 | |
| MARTIBackbone=Qwen2.5-14B, Cluster=48-node, NPU per node=162026.02 | 174.1 | 5.3 | 642.8 | |
| DistRLBackbone=Qwen2.5-14B, Cluster=48-node, NPU per node=162026.02 | 293.8 | 3.1 | 401 | |
| MAS-RLBackbone=Qwen2.5-14B, Cluster=48-node, NPU per node=162026.02 | 914.4 | 1 | 119 |