云霞资讯网

GPU推理瓶颈不是带宽,而是被忽略的延迟 重磅:TileRT 将解码交互速度提升

GPU推理瓶颈不是带宽,而是被忽略的延迟
重磅:TileRT 将解码交互速度提升了 1.9 倍!这一突破的前提条件完全没变:依然是相同的单 token 成本,依然是相同的英伟达 Blackwell GPU。这对 Groq、Cerebras 和 Sambanova 意味着什么?

一台 8 卡 HGX B200 服务器拥有 64 TB/s 的理论高带宽内存(HBM)带宽。当 batch size 为 1 时,NVFP4 精度下的 GLM-5 模型每生成一个 token 仅需约 21 GB 激活参数。按照 B200 带宽上限推算,如果不使用投机解码,单用户理论最高速度可达 3,047 token/s/user。实际应用中,GPU 根本达不到这个极限。

差距源于延迟,而非带宽。传统 GPU 编程模型需要启动并同步大量独立内核(kernel)。在超高交互场景下,内核启动与销毁开销会变得极为庞大。在常规服务速度下,这些延迟成本并不明显(即便使用 CUDA graphs)。一旦 token 延迟逼近亚毫秒级的每个输出 token 耗时(TPOT)区间,延迟就会成为绝对的性能瓶颈。GPU 显存带宽每一代增长约 2 到 3 倍,显存延迟却毫无改善。

这就是 TileRT 的用武之地。TileRT 不再频繁启动内核,也不重放内核有向无环图(DAG),而是让 GPU 持续执行一条常驻流水线。它提前将整个模型静态编译成一个常驻引擎内核。主机只需启动一次,整个解码生命周期都会常驻 GPU 运行。绝大部分运行时调度工作,也被直接前置到了编译阶段。

想获取完整解析,欢迎阅读我们最新的深度分析文章。

大模型 英伟达 GPU AI芯片