【推理优化】LLM 推理优化的下一步:前沿趋势与学习路径
过去三年推理优化简史如果说 2022 年是「大模型元年」,2023 年是「训练竞赛年」,那么 2024 年之后的主战场毫无悬念地转向了推理。一个残酷的现实是:训练一个模型是一次性的投入,而推理是每天亿万次的持续消耗。当 ChatGPT 在 2023 年初达到 1 亿月活时,其背后的推理成本估算已经超过每天 70 万美元。推理优化的每一次突破,都直接决定了 AI 产品能否从「演示可用」走向「商业可行」。从 vLLM 到 TensorRT-LLM:三个关键里程碑里程碑一:PagedAttention 与 vLLM(2023 年 6 月)在 vLLM 出现之前,GPU 显存管理上存在一个巨大的浪费:KV Cache 需要连续的内存块,而请求的长度无法预知,导致大量碎片化空隙。vLLM 团队将操作系统中的分页机制引入了 KV Cache 管理——把缓存切分为固定大小的块,按需分配,物理上不必连续。这个看似朴素的改动带来了吞吐量数倍的提升,更重要的是,它为后续所有推理引擎树立了「显存池化」的范式。里程碑二:连续批处理(Continuous Batching)的工业化(2023 年底)早期推理系统采用静态批处理:一批请求必须全部完成才