一个请求进入 LLM 推理引擎后,到底经历了什么? 程思顺 2026-09-13 22:03:26 一个请求进入 LLM 推理引擎后,到底经历了什么? Together AI 工程师 Zain 讲明白了一个请求的一生:一次传播产一个 token,prefill 吃算力、decode 吃显存,KV 缓存、连续批处理层层接力,Agent 循环再把 GPU 榨干。前缀缓存让 100 轮 Agent 计算量从 55 倍降到 10 倍。 https://x.com/shao__meng/status/2098783138118041760