一个请求进入 LLM 推理引擎后,到底经历了什么?
一个请求进入 LLM 推理引擎后,到底经历了什么?Together AI 工程师 Zain 讲明白了一个请求的一生:一次传播产一个 token,prefill 吃算力、decode 吃显存,KV 缓存、连续批处理层层接力,Agent 循环再把 GPU 榨干。前缀缓存让 100 轮 Agent 计算量从 55 倍降到 10 倍。
https://x.com/shao__meng/status/2098783138118041760
LLM 推理引擎到底是怎么工作的:从一个 token 到 KV 缓存、连续批处理,再到 Agent Loop 如何把 GPU 榨干
https://x.com/shao__meng/status/2098783138118041760
页:
[1]