查看: 5|回复: 0

过去十年 AI 硬件的演进史,本质是一部通用算力的自杀史:

[复制链接]

15

主题

0

回帖

45

积分

新手上路

积分
45
发表于 昨天 23:08 | 显示全部楼层 |阅读模式
过去十年 AI 硬件的演进史,本质是一部通用算力的自杀史:
从什么逻辑都能跑的 CPU,到数千核并行的 GPU,
再到波浪式流动的 TPU,以及边缘低功耗的 NPU,
直到最后连内存都不要的 LPU,
你得到的每一毫秒延迟降低,都是拿芯片的通用寿命换来的。

所以大家也别再以为 AI 算力竞争只是在拼谁的跑分更高,
把 CPU、GPU、TPU、NPU 和 LPU 的内部底裤扒开,全是一场算力与内存的血腥内战:
从什么都能干的 CPU,一路进化到把片外内存直接砍光的 LPU,
芯片设计师每往前走一步,都在亲手把通用性的退路彻底封死,
用丧失灵活性的代价,去换取把数据搬进计算核心的零等待。
一张光谱看懂 5 种 AI 芯片的生死权衡:
1️⃣ CPU 靠少数大核做全能总管:
深层缓存配上内存,跑操作系统和复杂逻辑无敌,但一碰到矩阵乘法就慢到绝望;
2️⃣ GPU 靠数千并发小核心暴力吞吐:
把算力铺成海量并发,专门吃神经网络的矩阵运算,死死焊牢大模型训练的霸主地位;
3️⃣ TPU 用脉动阵列让数据像波浪一样流淌:
乘积累加网格由编译器静态拉满,计算中间结果在芯片内直接传递,算完前绝不回传内存;
4️⃣ NPU 死磕个位数瓦特功耗:
神经计算引擎硬塞进片上缓存,用低功耗系统内存把推理生生塞进手机和手表;
5️⃣ LPU 彻底剔除片外内存干碎延迟:
所有权重全塞进片上静态缓存,实现零缓存未命中,代价是单片容量极小必须串联几百张芯片。
算力从来不是免费的午餐,
CPU 负责兜底人类全部的复杂逻辑,专用芯片负责在物理极限的悬崖边给大模型续命。
你现在部署大模型推理,用的是 GPU 的通用性还是 LPU 的极致延迟?



本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部