# 从 CPU 到 LPU：AI 硬件十年演进是一部通用算力的自杀史

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-09-03 10:20
- AIHOT 分数：42
- AIHOT 链接：https://aihot.virxact.com/items/cmtkx2vac08ziroalbqdo5r0q
- 原文链接：https://x.com/AYi_AInotes/status/2095336059915907369

## AI 摘要

作者梳理过去十年 AI 硬件演进，认为 CPU、GPU、TPU、NPU 到 LPU 的路线本质是用芯片通用性换取更低延迟的算力与内存内战。

## 正文

过去十年 AI 硬件的演进史,本质是一部通用算力的自杀史:
从什么逻辑都能跑的 CPU,到数千核并行的 GPU,
再到波浪式流动的 TPU,以及边缘低功耗的 NPU,
直到最后连内存都不要的 LPU,
你得到的每一毫秒延迟降低,都是拿芯片的通用寿命换来的。

所以大家也别再以为 AI 算力竞争只是在拼谁的跑分更高, 把 CPU、GPU、TPU、NPU 和 LPU 的内部底裤扒开,全是一场算力与内存的血腥内战:
从什么都能干的 CPU,一路进化到把片外内存直接砍光的 LPU, 芯片设计师每往前走一步,都在亲手把通用性的退路彻底封死, 用丧失灵活性的代价,去换取把数据搬进计算核心的零等待。
一张光谱看懂 5 种 AI 芯片的生死权衡:
1️⃣ CPU 靠少数大核做全能总管: 深层缓存配上内存,跑操作系统和复杂逻辑无敌,但一碰到矩阵乘法就慢到绝望;
2️⃣ GPU 靠数千并发小核心暴力吞吐: 把算力铺成海量并发,专门吃神经网络的矩阵运算,死死焊牢大模型训练的霸主地位;
3️⃣ TPU 用脉动阵列让数据像波浪一样流淌: 乘积累加网格由编译器静态拉满,计算中间结果在芯片内直接传递,算完前绝不回传内存;
4️⃣ NPU 死磕个位数瓦特功耗: 神经计算引擎硬塞进片上缓存,用低功耗系统内存把推理生生塞进手机和手表;
5️⃣ LPU 彻底剔除片外内存干碎延迟: 所有权重全塞进片上静态缓存,实现零缓存未命中,代价是单片容量极小必须串联几百张芯片。
算力从来不是免费的午餐, CPU 负责兜底人类全部的复杂逻辑,专用芯片负责在物理极限的悬崖边给大模型续命。
你现在部署大模型推理,用的是 GPU 的通用性还是 LPU 的极致延迟?

### 引用推文

> Akshay 🚀：https://x.com/i/article/2083865844082466816
