LLM Serving on Node multi-node inference workload
26.3Efficiency GainPALS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PALSObjective=Max tokens/J under power + QoS, Knobs=Power cap + batch (runtime), MoE support=✓2026.05 | 26.3 | 4 |
| Method | Links | ||
|---|---|---|---|
| PALSObjective=Max tokens/J under power + QoS, Knobs=Power cap + batch (runtime), MoE support=✓2026.05 | 26.3 | 4 |