Multi-Agent Reinforcement Learning training efficiency on Category Assistant (CA) (train)
78.8E2E Training Time (s)FlexMARL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FlexMARLBackbone=Qwen2.5-14B/32B, Cluster=48-node, NPU per node=162026.02 | 78.8 | 5.6 | 821.4 | |
| MARTIBackbone=Qwen2.5-14B/32B, Cluster=48-node, NPU per node=162026.02 | 112.8 | 3.9 | 655.9 | |
| DistRLBackbone=Qwen2.5-14B/32B, Cluster=48-node, NPU per node=162026.02 | 130 | 3.4 | 571.6 | |
| MAS-RLBackbone=Qwen2.5-14B/32B, Cluster=48-node, NPU per node=162026.02 | 438.6 | 1 | 265.5 |