Fleet Requirement Projection on Qwen3-235B workload (10,000 req/s on AMD MI300X)
137NodesToken-budget
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Token-budgetBackbone Model=Qwen3-235B-A22B, Hardware=AMD MI300X, Request Rate=10,000 req/s, Cloud Rate=$3.67/GPU-hr, Quantization=FP8, TP degree=82026.04 | 137 | 1,096 | 35.2 | 15.4 | |
| HomogeneousBackbone Model=Qwen3-235B-A22B, Hardware=AMD MI300X, Request Rate=10,000 req/s, Cloud Rate=$3.67/GPU-hr, Quantization=FP8, TP degree=82026.04 | 197 | 1,576 | 50.6 | — |