设备端推理正在重塑传感器堆栈

Adam J. Fleischer
|  已创建:August 12, 2026
At a Glance
本文探讨了设备端推理如何改变传感器的工作方式,重点强调了从传统数据流式传输转向本地处理,以实现更高的效率和更好的性能。随着分层唤醒系统、增强量化技术等进步的发展,如今评判传感器的标准,已不再只是其信号是否足够纯净,而是其为本地模型提供的数据质量。
Go Deeper with AI:
设备端推理正在重塑传感器堆栈

关键要点

  • 在设备端进行推理时,评判一个传感器的标准,不再主要是它能否干净地持续输出数据流,而更多取决于它交给附近模型的数据是否有用。 
  • 限制大多数边缘设计的,不是峰值 TOPS,而是内存带宽;而让模型装入片上内存的关键杠杆,则是 8 位量化。
  • 对于始终在线的设计,功耗优化依赖分层唤醒:应把每一次决策尽量下推到能完成该决策的最低成本级,因为搬运数据的代价往往高于计算本身。

推理正在转移到设备端

边缘 AI 正在于 2026 年 从试点阶段迈向主流产品。在当前 约 210 亿台已部署的联网 IoT 设备中,大多数仍然把数据发送到设备外部进行处理。但面向特定用途设计的芯片正把这项工作带回设备本身:首批配备 专用神经处理单元(NPU)的 STM32 微控制器已于 2024 年底进入量产,而入门价位的边缘 AI 模块价格也已下降到足以让本地推理成为一种经济上合理的默认选择。

传感器如今是在给模型“喂数据”

一旦推理在本地运行,评估传感器时关注的重点,就不再是它把信号数字化得有多干净,而是它输出的数据对旁边的模型有多大价值。这会带来三个结果:

  • 更干净、动态范围更宽的数据。 模型对噪声和削顶非常敏感,因此前端正在获得更大的余量。 双量程惯性测量单元(IMU)可以同时捕捉细微振动和强烈冲击,且不会在量程切换之间丢失数据。如今麦克风厂商也在提升声学过载点和信噪比,从而避免大音量事件在模型看到之前就已导致饱和。
  • 传感器内部集成计算。 IMU 中的 机器学习内核和传感器内处理单元、MEMS 麦克风内部的 AI 引擎,以及 芯片内视觉,都让器件可以输出一个决策结果或特征,而不是原始数据流,从而使主机能够保持休眠。
  • 稀疏、事件驱动的输出。 事件视觉传感器和声音唤醒麦克风都只会在发生变化时才占用带宽和计算资源,而不是全天候持续流式输出。

这些发展也有助于保护隐私。飞行时间传感器和雷达报告的是距离与运动,而不是图像;而传感器内视觉会把原始像素保留在芯片内部,因此存在检测传感器无需让摄像头画面离开器件,也能完成任务。

决定上限的是带宽,不是 TOPS

边缘 AI 器件最常被强调的指标通常是 TOPS(每秒万亿次运算),但它其实并不是设计选型时最该围绕的数字。两个标称 TOPS 相同的加速器,实际吞吐量可能 相差很大,因为性能取决于内存带宽、芯片支持哪些算子,以及厂商编译器能否高效地把你的网络映射到该硬件上。 

在大多数边缘设计中,真正的瓶颈是张量搬运:处理器往往会先因等待内存而停顿,而不是先把算力耗尽。对电池来说,更有参考意义的数字是每次推理的能耗,而不是峰值 TOPS。理解这一点时,可以把系统分成两种情况:模型驻留在片上 SRAM,或驻留在外部 DRAM。

微控制器场景

在微控制器上,系统上限受片上 SRAM 制约:通常只有 256 KB 到 512 KB。这个预算必须同时容纳模型的激活值和工作缓冲区(即运行时张量),因此模型必须足够小,并经过量化才能装得下,而其权重则存放在闪存中。量化就是关键杠杆:把权重从 32 位浮点数转换为 8 位整数,通常可以将模型体积 缩小约 3 到 4 倍,同时几乎不损失精度;这足以让一个量化后的 MobileNet 级网络落入约 1 MB 的闪存空间,而浮点版本则无法做到。

边缘 SoC 场景

对于运行视觉流水线或小型语言模型的更大边缘 SoC,约束会转移到外部 LPDDR 上。在这里,比起容量本身,更关键的是权重和激活值能够以多快的速度被流式传输。内存同样也是一个供应链问题。 2026 年 DRAM 产能向 AI 数据中心重新配置,推高了 LPDDR 价格并收紧了供应。厂商在带宽侧也面临同样的挑战:今年 5 月, Synaptics 将内存带宽称为设备端语言模型推理的首要瓶颈,并指出高强度权重压缩是夺回吞吐量的途径。

让大芯片最后再唤醒

要在不耗尽电池的前提下实现始终在线,关键在于按成本分层堆叠检测器:只有当更便宜的级别确认值得进一步处理时,昂贵的级别才会被唤醒。持续运行的那一层决定了系统的空闲功耗,因此设计的任务,就是让最底层尽可能省电,并让它去控制其上所有层级的开启。

麦克风层

智能 MEMS 麦克风以数十微安的电流运行一个用于 语音活动检测的小型神经网络;只有在听到语音后,才升级到更深层的模型做关键词识别,再之后才唤醒主机。

运动层

IMU 的机器学习内核可在传感器内部完成活动分类并发出中断。只有在检测到感兴趣的活动类别时,主机处理器和任何加速器才会从深度休眠中醒来。

存在检测层

60 GHz 雷达,例如 Infineon 的 BGT60LTR11AIP,或多区域飞行时间传感器,可借助片上处理完成存在检测;只有在确认有人存在后,才会唤醒摄像头或完整视觉流水线。

节能效果体现在这些产品大多数时间所处的状态:空闲。粗略来说,一个需要让主机始终保持唤醒来“监听”的系统,电流消耗会达到毫安级;而采用分层前端的系统,在空闲时仅为数十微安,只有在事件发生时才会在不到一秒的短时间内上升到毫安级。对于纽扣电池而言,始终在线但不分层,与采用分层唤醒之间的差别,足以决定寿命是按天算还是按年算。

把智能放在成本最低的层级

综合传感、存储和功耗来看,设计逻辑可以归结为两个应当指导器件选型的原则:

  • 让每个决策尽可能在更低层完成。 凡是 IMU、麦克风或存在传感器能够自行完成的分类,主机就无需为此被唤醒。
  • 搬运数据的代价高于计算。 通过总线传输数据,或把数据上传到云端,所消耗的能量往往比计算本身更高,因此应优先选择输出结果而非原始采样数据的器件。 

你每向传感器中下放一个功能,主机处理器、内存和接口就少承担一个功能。代价则是灵活性下降。当任务稳定且已被充分理解时,应把智能下推到传感器中;而当模型会频繁变化,或需要在现场重新训练时,则应把它保留在主机端,因为相比重新流片一个固定功能引擎,重刷固件要容易得多。 

若要判断每一部分智能应当位于系统栈中的哪个位置,可参见 The Edge-Sensing BOM: What to Spec, from IMUs to Interfaces,该文会按 BOM 条目逐项展开:IMU、飞行时间传感器、雷达、麦克风、传感器集线器、存储器以及接口。

关于作者

关于作者

Adam Fleischer is a principal at etimes.com, a technology marketing consultancy that works with technology leaders – like Microsoft, SAP, IBM, and Arrow Electronics – as well as with small high-growth companies. Adam has been a tech geek since programming a lunar landing game on a DEC mainframe as a kid. Adam founded and for a decade acted as CEO of E.ON Interactive, a boutique award-winning creative interactive design agency in Silicon Valley. He holds an MBA from Stanford’s Graduate School of Business and a B.A. from Columbia University. Adam also has a background in performance magic and is currently on the executive team organizing an international conference on how performance magic inspires creativity in technology and science. 

Related Technical Documentation

相关资源

返回主页
Thank you, you are now subscribed to updates.