查看: 5|回复: 0

🏆 震惊,DeepSeek 把自己训模型用的那套 GPU 算子库 DeepGEMM 开源了,同一块卡能多榨出一截算力。

[复制链接]

26

主题

0

回帖

78

积分

注册会员

积分
78
发表于 3 小时前 | 显示全部楼层 |阅读模式
🏆 震惊,DeepSeek 把自己训模型用的那套 GPU 算子库 DeepGEMM 开源了,同一块卡能多榨出一截算力。

GitHub 上 8909 star、1401 个 fork,9 月 30 日还顺手放出了昇腾版本。

做大模型推理的人都熟悉那种拧螺丝的日子:FP8 的矩阵乘一套,MoE 的分发和通信重叠又一套,索引器打分核再一套,每套都得盯着不同架构编一遍,装环境还要等 CUDA 编译半小时。

DeepGEMM 把这些原语收进同一份 CUDA 代码里,FP8、FP4、BF16 的矩阵乘、带通信重叠的融合 MoE,连 DeepSeek v3.2 那个闪电索引器的打分核都在内。所有核子靠 DeepJIT 在跑的时候现编,安装阶段不编译,省掉的就是你等编译的那段生命。它借了 CUTLASS 和 CuTe 的思路,但没堆进模板的汪洋大海,自己改也不至于绝望。

性能这块官方说法是在多种矩阵形状下追平或超过专家调优过的库,H800 上最高到 1550 TFLOPS。

好的底层库不加功能,只负责把你的卡还给你。

GitHub:
[url=https://github.com/deepseek-ai/DeepGEMM][/url]

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部