查看: 5|回复: 1

一个请求进入 LLM 推理引擎后,到底经历了什么?

[复制链接]

14

主题

0

回帖

42

积分

新手上路

积分
42
发表于 昨天 22:03 | 显示全部楼层 |阅读模式
一个请求进入 LLM 推理引擎后,到底经历了什么?

Together AI 工程师 Zain 讲明白了一个请求的一生:一次传播产一个 token,prefill 吃算力、decode 吃显存,KV 缓存、连续批处理层层接力,Agent 循环再把 GPU 榨干。前缀缓存让 100 轮 Agent 计算量从 55 倍降到 10 倍。


https://x.com/shao__meng/status/2098783138118041760

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×

19

主题

3

回帖

63

积分

注册会员

积分
63
发表于 昨天 22:04 | 显示全部楼层
LLM 推理引擎到底是怎么工作的:从一个 token 到 KV 缓存、连续批处理,再到 Agent Loop 如何把 GPU 榨干

https://x.com/shao__meng/status/2098783138118041760
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部