从 CPU 到 LPU:AI 硬件十年演进是一部通用算力的自杀史

AYi · @AYi_AInotes · X·2026-09-03 10:20·1天前
AI 导读

作者梳理过去十年 AI 硬件演进,认为 CPU、GPU、TPU、NPU 到 LPU 的路线本质是用芯片通用性换取更低延迟的算力与内存内战。

AYi@AYi_AInotes
42AI 编辑部评分,满分 100

从 CPU 到 LPU:AI 硬件十年演进是一部通用算力的自杀史

2026-09-03 10:20· 1天前
AI 导读

作者梳理过去十年 AI 硬件演进,认为 CPU、GPU、TPU、NPU 到 LPU 的路线本质是用芯片通用性换取更低延迟的算力与内存内战。

过去十年 AI 硬件的演进史,本质是一部通用算力的自杀史: 从什么逻辑都能跑的 CPU,到数千核并行的 GPU, 再到波浪式流动的 TPU,以及边缘低功耗的 NPU, 直到最后连内存都不要的 LPU, 你得到的每一毫秒延迟降低,都是拿芯片的通用寿命换来的。

所以大家也别再以为 AI 算力竞争只是在拼谁的跑分更高,
把 CPU、GPU、TPU、NPU 和 LPU 的内部底裤扒开,全是一场算力与内存的血腥内战: 从什么都能干的 CPU,一路进化到把片外内存直接砍光的 LPU,
芯片设计师每往前走一步,都在亲手把通用性的退路彻底封死,
用丧失灵活性的代价,去换取把数据搬进计算核心的零等待。 一张光谱看懂 5 种 AI 芯片的生死权衡: 1️⃣ CPU 靠少数大核做全能总管:
深层缓存配上内存,跑操作系统和复杂逻辑无敌,但一碰到矩阵乘法就慢到绝望; 2️⃣ GPU 靠数千并发小核心暴力吞吐:
把算力铺成海量并发,专门吃神经网络的矩阵运算,死死焊牢大模型训练的霸主地位; 3️⃣ TPU 用脉动阵列让数据像波浪一样流淌:
乘积累加网格由编译器静态拉满,计算中间结果在芯片内直接传递,算完前绝不回传内存; 4️⃣ NPU 死磕个位数瓦特功耗:
神经计算引擎硬塞进片上缓存,用低功耗系统内存把推理生生塞进手机和手表; 5️⃣ LPU 彻底剔除片外内存干碎延迟:
所有权重全塞进片上静态缓存,实现零缓存未命中,代价是单片容量极小必须串联几百张芯片。 算力从来不是免费的午餐,
CPU 负责兜底人类全部的复杂逻辑,专用芯片负责在物理极限的悬崖边给大模型续命。 你现在部署大模型推理,用的是 GPU 的通用性还是 LPU 的极致延迟?

Akshay 🚀https://x.com/i/article/2083865844082466816