查看: 9|回复: 0

技术博文:SGLang 中的高级 CUDA Graph 技术

[复制链接]

12

主题

0

回帖

36

积分

新手上路

积分
36
发表于 昨天 11:51 | 显示全部楼层 |阅读模式
技术博文:SGLang 中的高级 CUDA Graph 技术
地址:www.lmsys.org/blog/2026-08-17-advanced-cuda-graph

背景知识:大模型推理时由许多 GPU 操作连续组成。通常,CPU 需要逐个向 GPU 发起这些操作,频繁的启动和调度会成为性能瓶颈。CUDA Graph 的作用,是提前把一组 GPU 操作记录下来,后续直接整体重放,从而减少 CPU 的参与和 GPU 的等待时间。不过,CUDA Graph 更适合形状和执行流程相对固定的任务。

“CUDA Graph 承诺消除内核启动开销,但要在真实推理引擎中接近这一理想收益,就必须尽可能覆盖更多工作负载,同时不能牺牲兼容性、启动速度或内存效率。

在 SGLang 中,我们围绕统一的 Runner/Backend 接口重构了 CUDA Graph 支持,让不同捕获策略可以在多种执行路径之间复用。针对更加复杂的 prefill 阶段,SGLang 社区推出了 Breakable CUDA Graph,并率先结合 FA4 和 FlashInfer 注意力后端实现完整 CUDA Graph。这两项技术最初都作为开源推理服务方案诞生于 SGLang。

文章还将深入讨论 CUDA Graph 的内存管理,包括不同形状及不同图分段之间的内存复用;这正在成为 SGLang 整体内存管理中越来越重要的一部分。

对于 prefill,Breakable CUDA Graph 现已成为 SGLang 的默”

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部