A-47为何只做AEC+ENC:22mA功耗下的算力预算分析

发布时间:2026/8/3 0:36:27
A-47为何只做AEC+ENC:22mA功耗下的算力预算分析 一、一个反直觉的产品定位在同一个产品家族里A-29P、A59P、AU-60、WX-0813 都标称AI 降噪用的是神经网络方法而 A-47 的规格里只有 AEC 和 ENC没有 AI。从营销角度看这像是低配但如果把工作电流放在一起对比事情就有另一种解读A-4722-25mAA-29P28-35mAA-59U35-60mAA59P / AU-60 / AU-4865-80mAWX-0813静态 95-100mAA-47 的工作电流大约是 A59P 的三分之一。这个差距不是外围电路省出来的主要来自 DSP 内核跑的算法复杂度不同。本文想讨论的就是在 22mA 这个功耗预算下能做什么不能做什么以及这个取舍在什么场景下是划算的。二、算力去哪儿了三类算法的开销对比把免提通话链路上的主要算法按计算量排个序大致是这样的量级关系。AEC中等但内存开销大自适应回音消除的主体是一个长抽头 FIR 滤波器加上系数更新。A-47 标称 AEC 90dB、容忍空间延迟 100ms。100ms 在 16kHz 采样率下对应 1600 抽头。若采用时域 NLMS每个采样点需要 2N 次乘加滤波 N 次 更新 N 次即约 3200 MAC/样本16kHz 下约 51 MMAC/s。实际实现基本都用频域分块自适应滤波PBFDAF把复杂度从 O(N) 降到 O(log N) 量级实测算力需求可以压到个位数 MMAC/s。真正的成本转移到了内存1600 抽头的系数、参考信号延迟线、频域缓冲加起来是几十 KB 级别的 RAM。这就是为什么 AEC 的延迟容忍度往往由片上 RAM 决定而不是由算力决定。传统 ENC低基于谱减法或维纳滤波的噪声抑制核心是一次 FFT、一次噪声谱估计、一次增益计算、一次 IFFT。256 点 FFT 在 16kHz、50% 重叠下每秒约 125 帧算力需求在 1 MMAC/s 以下。这是这条链路上最便宜的一环。A-47 标称 45dB ENC双麦近距离模式下可达 90dB。注意后一个数字的前提条件——双麦 近距离说明那 90dB 主要不是靠单通道谱处理拿到的而是靠两个麦克风的空间差分。空间差分同样很便宜本质上是两路信号做加权相减算力可以忽略。神经网络降噪高这是量级完全不同的一档。即便是为嵌入式优化过的小型 RNN/CRN 模型参数量通常也在几十万到几百万每帧需要做一次完整前向推理。以 30 万参数、每秒 100 帧计算仅乘加就是 30 MMAC/s 起步加上激活函数、归一化等非线性运算的开销实际负载更高。同时权重需要常驻存储Flash 和 RAM 占用都显著上升。把三者叠起来AEC 传统 ENC 的组合算力需求在个位数 MMAC/s换成 AEC 神经网络降噪跳到几十 MMAC/s。DSP 主频和电流基本随之线性上升。22mA 与 65mA 之间的差距主要就是这一项。三、90dB AEC 与 100dB AEC 的实际差距A-47 标称 90dB AEC家族里多数型号标称 100dB。10dB 听起来不多值得掰开看。AEC 的抑制量描述的是回声在处理前后的能量比。90dB 对应约 31623 倍衰减100dB 对应 100000 倍。从数值看是三倍多的差距但实际系统里几乎不会有哪一端真的跑满标称值——限制因素在别处。决定实际回音表现的通常是以下几项任何一项都可能把有效抑制量压到 40~60dB参考信号是否包含功放和扬声器的非线性前端取参考时不包含结构件传导的机械耦合这条路径不经过空气参考信号里也没有回声路径的时变性外壳形变、有人走动、手持设备移动双讲double-talk期间自适应是否被正确冻结A-47 的规格里给了一个更有信息量的描述在结构合理状态下喇叭音量达 100dB、麦克风距喇叭 6cm 仍可消除回音。这句话比90dB有用得多因为它给出了边界条件结构合理、6cm 间距。对比 A-29P 的95dB 喇叭、1cm 间距可以看出两者的适用结构不同——A-47 更适合喇叭与麦克风有一定间距的布局A-29P 能扛更紧凑的结构。选型时按这两个物理描述来判断比按 90 还是 100 来判断可靠。四、双麦空间差分便宜且有效的降噪路径A-47 不做神经网络但通过双麦布置能把降噪推到 90dB 量级近距离模式。这条路径的原理和适用条件值得说清楚。两个麦克风分别拾取信号若说话人靠近主麦其在主麦的电平明显高于次麦而远处的噪声源到两个麦克风的距离差很小电平接近。把次麦信号按一定权重从主麦信号中减去远场噪声大量抵消近场语音得以保留。这就是近场差分阵列的基本思路。规格文档里给出的使用建议其实是这个原理的直接推论主次麦克风朝向不一致主麦朝人嘴次麦朝噪音源——最大化两路信号的差异主次麦灵敏度可差异化搭配噪音严重时次麦可选更高灵敏度——调整相减权重主说话人声音在主次麦的拾取差值越大越好——这是决定抑制上限的核心量这套方法的代价是对结构强依赖。麦克风间距、朝向、外壳开孔位置一旦变化抵消效果就变。而神经网络降噪对结构的依赖弱得多换个外壳基本不用重调。所以这不只是性能高低的差别而是调试成本前置还是后置的差别空间差分把成本放在结构设计阶段神经网络把成本放在芯片功耗和物料上。五、六种固件的组合逻辑A-47 提供两种功能模式 × 三种拾音距离近/中/远共六个固件版本。这种做法与 A59P、AU-60 的 T1/T2 引脚切换形成对比。引脚切换的好处是灵活同一批模块可以在板上通过两个电阻改档甚至由 MCU 动态切换。代价是 Flash 里要同时存放多套参数且切换逻辑本身占用引脚——A59P 用掉了端口 9 和端口 11 两个脚。固件区分的好处是省资源每个固件只带自己那一套参数不需要额外引脚也不需要切换逻辑。代价是库存管理复杂且现场无法调整。对于 A-47 这种 23mm×20mm 的紧凑封装、22mA 的功耗预算把引脚和存储都省下来是符合整体取向的选择。实际影响是采购流程A-47 需要在下单时明确固件版本装配后无法更改。如果产品有多个结构变体比如壁挂版和台式版说话距离不同需要按变体分别备料。六、-45℃另一个被低估的差异点A-47 的工作温度是 -45℃85℃是这个家族里下限最低的。对比A-59U 为 -40℃85℃A-29P 为 -20℃85℃A59P / AU-60 / A-59F 标准版为 -20℃70℃可选工业级。-45℃ 与 -20℃ 之间的差距在器件选型上是实打实的成本。低温下电解电容 ESR 急剧上升、晶振频差扩大、LDO 压差特性变化、锂电池几乎不能工作。做到 -45℃ 意味着整条 BOM 都要按工业级或军规选型。这也反过来解释了 A-47 的定位楼宇对讲、矿山呼叫、电梯广播、户外安防——这些场景的共同点是长期部署在非空调环境可能在北方冬季的室外或者井下低温区。这类设备对功耗和温度范围敏感对是不是 AI 降噪反而没那么敏感因为噪声类型相对固定风机、机械、车辆传统方法就能处理得不错。七、适用与不适用把上面几点归拢A-47 适合的情形是噪声以稳态为主、结构可控麦克风布置能按建议设计、功耗敏感或供电能力有限、温度范围要求宽、产品结构变体少。不适合的情形是噪声类型复杂多变且以非稳态冲击噪声为主工地敲击、金属碰撞、结构紧凑到麦克风与喇叭间距小于 6cm、产品需要现场切换拾音距离、或者需要 USB / I2S 等数字接口。后面这些需求对应的是家族里功耗更高、接口更丰富的型号。模块选型经常被简化成看谁指标高但 22mA 和 65mA 之间的差距在电池供电设备上可能就是续航翻倍与否的区别。把功耗、温度范围、结构约束和噪声类型一起纳入考虑得到的结论往往和只看降噪 dB 数不一样。