边缘 AI 正在于 2026 年 从试点阶段迈向主流产品。在当前 约 210 亿台已部署的联网 IoT 设备中,大多数仍然把数据发送到设备外部进行处理。但面向特定用途设计的芯片正把这项工作带回设备本身:首批配备 专用神经处理单元(NPU)的 STM32 微控制器已于 2024 年底进入量产,而入门价位的边缘 AI 模块价格也已下降到足以让本地推理成为一种经济上合理的默认选择。
一旦推理在本地运行,评估传感器时关注的重点,就不再是它把信号数字化得有多干净,而是它输出的数据对旁边的模型有多大价值。这会带来三个结果:
这些发展也有助于保护隐私。飞行时间传感器和雷达报告的是距离与运动,而不是图像;而传感器内视觉会把原始像素保留在芯片内部,因此存在检测传感器无需让摄像头画面离开器件,也能完成任务。
边缘 AI 器件最常被强调的指标通常是 TOPS(每秒万亿次运算),但它其实并不是设计选型时最该围绕的数字。两个标称 TOPS 相同的加速器,实际吞吐量可能 相差很大,因为性能取决于内存带宽、芯片支持哪些算子,以及厂商编译器能否高效地把你的网络映射到该硬件上。
在大多数边缘设计中,真正的瓶颈是张量搬运:处理器往往会先因等待内存而停顿,而不是先把算力耗尽。对电池来说,更有参考意义的数字是每次推理的能耗,而不是峰值 TOPS。理解这一点时,可以把系统分成两种情况:模型驻留在片上 SRAM,或驻留在外部 DRAM。
在微控制器上,系统上限受片上 SRAM 制约:通常只有 256 KB 到 512 KB。这个预算必须同时容纳模型的激活值和工作缓冲区(即运行时张量),因此模型必须足够小,并经过量化才能装得下,而其权重则存放在闪存中。量化就是关键杠杆:把权重从 32 位浮点数转换为 8 位整数,通常可以将模型体积 缩小约 3 到 4 倍,同时几乎不损失精度;这足以让一个量化后的 MobileNet 级网络落入约 1 MB 的闪存空间,而浮点版本则无法做到。
对于运行视觉流水线或小型语言模型的更大边缘 SoC,约束会转移到外部 LPDDR 上。在这里,比起容量本身,更关键的是权重和激活值能够以多快的速度被流式传输。内存同样也是一个供应链问题。 2026 年 DRAM 产能向 AI 数据中心重新配置,推高了 LPDDR 价格并收紧了供应。厂商在带宽侧也面临同样的挑战:今年 5 月, Synaptics 将内存带宽称为设备端语言模型推理的首要瓶颈,并指出高强度权重压缩是夺回吞吐量的途径。
要在不耗尽电池的前提下实现始终在线,关键在于按成本分层堆叠检测器:只有当更便宜的级别确认值得进一步处理时,昂贵的级别才会被唤醒。持续运行的那一层决定了系统的空闲功耗,因此设计的任务,就是让最底层尽可能省电,并让它去控制其上所有层级的开启。
智能 MEMS 麦克风以数十微安的电流运行一个用于 语音活动检测的小型神经网络;只有在听到语音后,才升级到更深层的模型做关键词识别,再之后才唤醒主机。
IMU 的机器学习内核可在传感器内部完成活动分类并发出中断。只有在检测到感兴趣的活动类别时,主机处理器和任何加速器才会从深度休眠中醒来。
60 GHz 雷达,例如 Infineon 的 BGT60LTR11AIP,或多区域飞行时间传感器,可借助片上处理完成存在检测;只有在确认有人存在后,才会唤醒摄像头或完整视觉流水线。
节能效果体现在这些产品大多数时间所处的状态:空闲。粗略来说,一个需要让主机始终保持唤醒来“监听”的系统,电流消耗会达到毫安级;而采用分层前端的系统,在空闲时仅为数十微安,只有在事件发生时才会在不到一秒的短时间内上升到毫安级。对于纽扣电池而言,始终在线但不分层,与采用分层唤醒之间的差别,足以决定寿命是按天算还是按年算。
综合传感、存储和功耗来看,设计逻辑可以归结为两个应当指导器件选型的原则:
你每向传感器中下放一个功能,主机处理器、内存和接口就少承担一个功能。代价则是灵活性下降。当任务稳定且已被充分理解时,应把智能下推到传感器中;而当模型会频繁变化,或需要在现场重新训练时,则应把它保留在主机端,因为相比重新流片一个固定功能引擎,重刷固件要容易得多。
若要判断每一部分智能应当位于系统栈中的哪个位置,可参见 The Edge-Sensing BOM: What to Spec, from IMUs to Interfaces,该文会按 BOM 条目逐项展开:IMU、飞行时间传感器、雷达、麦克风、传感器集线器、存储器以及接口。