ResearchBenchmarksLLM Serving on Azure-ConvFollow8.02Throughput (req/s)DUETSERVE5.59686.22596.8557.4841Nov 6, 2025Evaluation ResultsMethodMethodLinksThroughput (req/s)TTFT (s)TBT (ms)Average GPU UtilizationDUETSERVEModel=Qwen3-32B, Clust...Model=Qwen3-32B, Cluster Size=Eight-GPU, QPS=24, Parallelism Strategy=TP = 82025.118.0258.9104.793.5DYNAMOModel=Qwen3-32B, Clust...Model=Qwen3-32B, Cluster Size=Eight-GPU, QPS=24, Parallelism Strategy=Starts at 4P+4D and reconfigures (e.g., to 6P+2D or 2P+6D)2025.115.69110.223.174.6