很多AI数字人在安静办公室里测试时表现不错,但一放到展厅、门店、会议室或活动现场,识别效果就会明显下降。
用户明明说的是“能不能接企业知识库”,系统却只识别出几个零散词;
背景音乐一响,数字人频繁误触发;
周围有人交谈时,数字人甚至不知道该听谁说话。
这类问题不一定是大模型不够强,也不一定是语音识别模型太差。很多时候,真正的问题是进入语音识别前的音频太乱。
这就需要用到 NS噪声抑制技术。
它的任务不是让现场完全安静,而是尽量从复杂声音中保留用户人声,同时压低空调声、风扇声、音乐声和环境杂音。
一、什么是NS噪声抑制?
NS是Noise Suppression的缩写,中文通常叫噪声抑制或语音降噪。
麦克风收到的声音通常不是单纯的人声,而是:
用户语音 + 环境噪声 + 设备噪声 + 其他人员声音。
NS技术会分析这段混合音频,判断哪些部分更像有效语音,哪些部分更像噪声,然后降低噪声部分的能量。
处理后的音频再交给VAD语音检测和ASR语音识别。
简单理解:
原始麦克风声音很杂,
NS先把背景声压下去,
ASR再从更干净的音频中识别用户说了什么。
因此,NS是数字人实时语音链路中的基础模块。
二、哪些声音属于数字人需要处理的噪声?
真实场景中的噪声并不完全相同,大致可以分为两类。
1、相对稳定的噪声
这类噪声变化不大,例如:
- 空调运行声
- 电脑风扇声
- 电流底噪
- 设备持续运转声
稳定噪声比较容易估计。系统可以先观察一段没有人说话的音频,计算背景噪声大概处于什么水平,然后进行持续削弱。
2、不断变化的噪声
这类噪声更难处理,例如:
- 展厅背景音乐
- 周围人员说话
- 突然的脚步声
- 敲击声
- 车辆和施工声音
因为这些声音会变化,有些频率还和人声很接近。系统如果判断错误,就可能把用户语音一起削弱。
这也是为什么AI数字人在真实展厅里的降噪,比安静办公室测试难得多。
三、传统噪声抑制是怎么工作的?
传统噪声抑制通常会先把音频拆成很多很短的片段,然后把每一段声音转换成频谱。
频谱可以理解为:
当前这段声音里,不同频率分别有多强。
例如,空调低频声可能集中在较低频段,人声则分布在更宽的频率范围内。
系统会先估算噪声频谱,再从当前音频频谱中削弱这些噪声成分。
常见方式包括:
- 频谱减法
- 维纳滤波
- 噪声门限
- 动态频段衰减
这类方法计算量小、处理速度快,适合实时设备。但面对音乐、人群说话等复杂噪声时,效果可能不够稳定。
四、神经网络降噪为什么效果更自然?
现在更先进的NS通常会加入神经网络。
神经网络会通过大量人声与噪声样本学习:
什么样的频谱更像人声;
什么样的变化更像环境噪声;
哪些频率应该保留;
哪些部分可以削弱。
系统通常不会简单地把某个频段全部删除,而是生成一个“语音掩码”。
这个掩码会告诉系统:
这一部分更可能是人声,尽量保留;
这一部分更可能是噪声,可以降低;
这一部分无法确定,需要谨慎处理。
相比传统固定滤波,神经网络降噪更能适应变化中的环境,也更容易保留自然语音。
五、为什么降噪不能越强越好?
很多人会认为,噪声压得越低,识别效果就越好。
实际并不是这样。
如果降噪强度过大,系统可能把人声中的细节一起削掉,尤其是:
- 辅音
- 轻声
- 句尾
- 较低音量的词
- 英文缩写和专业术语
例如,用户说“CRM系统”,如果部分辅音被过度抑制,ASR可能只识别出不完整的发音。
过度降噪还会让声音出现:
- 金属感
- 水下感
- 断断续续
- 声音发闷
- 字音缺失
所以NS的目标不是把噪声全部消灭,而是在降低噪声的同时,尽量保留完整人声。
六、信噪比为什么会影响识别准确率?
信噪比可以理解为:用户声音和背景噪声之间的差距。
用户声音越明显,噪声越小,信噪比越高,语音识别越容易。
如果用户离麦克风很远,背景音乐又很大,用户声音可能和噪声差不多强。这时,即使有NS,系统也很难完全恢复清晰人声。
因此,提升识别效果不能只依赖软件,还需要合理设计现场硬件:
- 麦克风尽量靠近用户
- 避免麦克风正对扬声器
- 控制背景音乐音量
- 展厅可使用定向麦克风
- 大空间可使用麦克风阵列
好的音频输入,比后期强行降噪更有效。
七、NS为什么要和AEC、VAD一起使用?
AI数字人的语音前处理通常不是只有NS一个模块。
常见链路是:
AEC回声消除 → NS噪声抑制 → AGC音量控制 → VAD语音检测 → ASR语音识别。
AEC负责去掉数字人自己播放的声音;
NS负责降低环境噪声;
AGC负责调整用户音量;
VAD负责判断用户是否正在说话;
ASR负责把语音转成文字。
如果AEC没有先处理好,数字人自身声音可能被NS和VAD误判;
如果NS过强,VAD可能检测不到用户轻声说话;
如果AGC把噪声放大,识别准确率也会下降。
所以这些模块必须整体调试,而不能只单独打开一个降噪功能。
八、企业如何测试数字人的噪声抑制能力?
企业测试AI数字人时,不能只在安静房间里说标准句子。
可以模拟真实场景:
播放背景音乐后提问;
让多人在附近交谈;
在空调和设备持续运行时测试;
让用户站在不同距离说话;
测试轻声、快速说话和专业术语;
比较开启与关闭降噪后的识别结果。
测试时应重点观察:
数字人是否频繁误触发;
用户说话是否被切掉;
专业词是否还能识别准确;
声音是否出现明显金属感;
接入降噪后响应速度是否变慢。
真正成熟的NS,不只是让声音听起来更干净,还要保证ASR能更准确地识别内容。
九、金福来数字人的复杂环境体验离不开NS技术
金福来数字人要真正应用到官网、展厅、门店、会议室和培训场景中,就必须面对不同设备和环境噪声。
企业评估时不应只看安静环境下的展示效果,更要关注:
是否支持实时噪声抑制;
能否处理持续噪声和变化噪声;
是否会过度削弱用户声音;
能否与AEC、VAD和ASR协同;
在展厅和门店中是否仍能稳定识别。
这些能力越成熟,数字人在真实环境中的误识别和误触发就越少。
结语
AI数字人一到嘈杂环境就听不清,不一定是大模型出了问题。
很多时候,是麦克风收到的背景噪声太多,导致VAD判断错误、ASR识别偏差。
NS噪声抑制负责从混合音频中降低环境杂音;
传统滤波适合处理稳定噪声;
神经网络降噪更适合复杂变化环境;
合理控制抑制强度,才能避免损伤用户语音。
真正好用的AI数字人,不只要在安静房间里听得清,还要在展厅、门店和会议室这些真实环境中,依然能准确接住用户的问题。

