近几年,"NPU"这个词随着手机发布会和"AI PC"概念频繁出现:苹果的 Neural Engine、高通的 Hexagon、英特尔的 AI Boost、AMD 的 XDNA……它们都有一个共同的名字:NPU(Neural Processing Unit,神经网络处理单元)。这篇文章把它的来龙去脉讲清楚。
一句话定义
NPU 是专门为神经网络推理(偶尔也做训练)优化设计的处理器。它把 AI 计算中最常见的"矩阵乘法 + 激活函数"做成硬件电路,用极高的并行度换取远超 CPU、GPU 的能效比。
为什么不能只靠 CPU / GPU
神经网络推理的特点是:计算模式单一(大量乘加)、数据吞吐巨大、但对精度要求宽容。
- CPU 擅长复杂的逻辑分支,但核心数少,跑卷积这类"重复劳动"又慢又费电。
- GPU 并行度极高,但功耗大、体积大,很难塞进手机,也不适合"常驻低功耗推理"。
- NPU 只做一件事:把乘加阵列(MAC Array)铺满芯片,配合低精度量化(INT8/INT4),在几瓦甚至零点几瓦的功耗下完成推理。
NPU 是怎么工作的
以最典型的卷积层为例:输出像素 = 输入窗口 × 权重矩阵的乘累加。NPU 内部排列着成百上千个乘加单元,它们在同一时钟周期内同时计算,一次"流水"就能处理整张特征图的一行。再加上:
- 量化:把 32 位浮点权重压缩成 8 位甚至 4 位整数,速度翻倍、显存减半,精度损失可接受。
- 数据复用:权重与激活值在片上缓存反复重用,减少对内存带宽的依赖。
- 专用指令:ReLU、池化、归一化等算子直接做成硬件单元,省去取指令的开销。
一张表看懂 CPU / GPU / NPU
| 维度 | CPU | GPU | NPU |
|---|---|---|---|
| 擅长 | 复杂逻辑、分支 | 大规模并行渲染/计算 | AI 推理的乘加流水 |
| 精度 | 高(FP64/FP32) | 较高(FP32/FP16) | 低(INT8/INT4 为主) |
| 功耗 | 中 | 高 | 极低 |
| 典型场景 | 操作系统、业务逻辑 | 游戏渲染、科学计算 | 端侧语音/图像/大模型 |
你身边的 NPU
- 苹果:Neural Engine(A 系列与 M 系列芯片内置)。
- 高通:Hexagon DSP 内的 NPU 模块(骁龙平台)。
- 英特尔:AI Boost / NPU(酷睿 Ultra 系列)。
- AMD:XDNA NPU(锐龙 AI 系列)。
- 华为:昇腾(Ascend)系列,覆盖端侧到数据中心。
- 谷歌:TPU(更多用于云端训练与推理)。
衡量 NPU 的指标:TOPS
NPU 的算力通常用 TOPS(每秒万亿次整数运算)衡量。当前旗舰手机 NPU 普遍在 30–70 TOPS 之间,AI PC 则宣称 40+ TOPS。注意:不同厂商对 TOPS 的统计口径(是否计入稀疏化、INT8 还是 INT4)并不完全一致,跨平台对比时只能看个量级。
NPU 带来的实际体验
- 端侧大模型:手机/笔记本本地跑 1B–14B 参数的小模型,无需联网,隐私安全。
- 实时图像处理:拍照夜景降噪、背景虚化、超分辨率,过去要"云端处理"的现在本机瞬间完成。
- 语音与感知:语音助手唤醒词、实时字幕、手势识别,常驻低功耗运行。
结语
NPU 的本质,是把 AI 最频繁的运算"硬件化",用专用性换取能效比。它不会取代 CPU 和 GPU,而是三者各司其职:CPU 管逻辑、GPU 管渲染、NPU 管推理。下次看到手机发布会上的"TOPS"数字时,你就知道它背后是一块多么专一的芯片了。