投机解码 现代LLM的工作阶段一般分为预填充(Prefill)阶段和推理(Decode)阶段。 前者是GPU发挥最大算力的最佳阶段,而后者从token序列的角度上来看,是逐token串行的,因此前向传播退化为矩阵-向量乘法,GPU实际上计算单元是空闲的。 这也是为什么实际工业提出了PD结耦的概念:当Prefill阶段需要更多计算单元(compute-bound)、Decoder阶段需要更大带宽时(memory-bandwidth-bound),将两者放在各自适配的设备上明显更加合理。 当然,本文主要讨论投机解码的解决方式,聚焦于投机解码是如何解决一般推理过程中计算单元的利用率问题,以及如