很多企业在使用AI数字人时,会遇到一种很奇怪的现象:
数字人正在回答问题,突然又停下来;
系统把数字人自己的声音识别成了新问题;
现场没人说话,数字人却再次开始回答;
严重时,甚至会出现数字人“自己问、自己答”的情况。
这类问题看起来像是语音识别出了故障,实际上很多时候,真正的问题在于AEC回声消除技术没有做好。
AI数字人在实时交流时,一边要通过扬声器播放自己的声音,一边又要通过麦克风监听用户说话。如果麦克风把扬声器里的声音重新收进去,系统就可能误以为“用户又说话了”。
所以,AI数字人要实现自然对话,不仅要会听,还要先学会分清:
哪一个声音来自用户,哪一个声音来自自己。
一、AI数字人为什么会听见自己的声音?
以展厅数字人为例。
数字人通过大屏音响回答用户问题,声音会在室内传播。
与此同时,麦克风仍然处于开启状态,继续监听用户是否插话。
这时,数字人的声音可能经过墙面、地面、玻璃反射,再次进入麦克风。
系统接收到的声音里,就会同时包含:
用户说话;
数字人播放的声音;
现场背景噪声;
室内反射产生的回声。
如果没有AEC处理,语音识别系统很难判断这些声音分别来自哪里。
最终就容易出现:
把数字人的回答当成用户输入;
把回声识别成新的句子;
错误触发VAD;
错误中断当前回答。
二、什么是AEC回声消除?
AEC全称是 Acoustic Echo Cancellation,中文叫声学回声消除。
它的作用是:
从麦克风收到的混合声音中,尽量去掉扬声器播放出来的那部分声音。
简单理解,系统同时掌握两路音频。
第一路是数字人准备播放的原始声音,叫参考信号。
第二路是麦克风实际收到的声音,里面包含用户声音、背景噪声和回声。
AEC会把参考信号和麦克风信号进行比较,判断麦克风里哪些声音来自数字人自己,然后尽量把这部分回声减掉。
处理之后,留下来的声音才会继续送给VAD和语音识别系统。
三、参考音频为什么很重要?
AEC并不是靠“猜”来消除回声。
它需要提前知道数字人当前正在播放什么声音。
这段正在播放的声音,就是参考音频。
例如数字人正在说:
“我们的系统支持企业知识库接入。”
系统会把这段原始语音保留下来,同时观察麦克风里是否又出现了类似波形。
如果麦克风接收到的声音与参考音频高度相似,AEC就会判断,这部分大概率是扬声器回传的声音,而不是用户说话。
没有参考音频,系统很难准确判断回声来源。
所以企业级数字人系统通常需要在音频播放端和收音端之间建立同步链路。
四、自适应滤波:为什么每个场景的回声都不一样?
同一段声音,在不同房间里产生的回声完全不同。
小会议室的回声路径较短;
展厅空间大,反射时间更长;
玻璃墙面反射更明显;
扬声器和麦克风距离不同,也会改变回声效果。
所以AEC不能只使用一套固定规则。
它通常需要使用自适应滤波技术,持续估算当前环境中的回声路径。
通俗地说,自适应滤波会不断学习:
声音从扬声器播放后,经过多长时间进入麦克风;
声音在传播过程中发生了哪些变化;
哪些频率被放大,哪些频率被削弱。
系统根据这些变化,实时调整消除参数。
这也是为什么有些数字人在安静办公室里表现正常,换到大展厅后却开始误触发。很多时候,并不是模型变差,而是回声环境发生了变化。
五、双讲检测:用户打断时,不能把用户声音一起消掉
AEC最难的情况,不是只有数字人在说话,而是数字人和用户同时说话。
例如数字人正在介绍产品,用户突然打断:
“等一下,我想先问价格。”
这时麦克风里同时存在:
数字人的声音;
用户的声音;
环境回声。
如果AEC处理过强,可能会把用户声音也一起削弱。
如果处理过弱,又可能残留大量数字人回声。
所以系统需要双讲检测,也就是判断当前是不是两边同时在说话。
双讲检测启动后,系统会更谨慎地调整回声消除强度,尽量保留用户插话,同时削弱数字人自身回声。
这项技术直接影响数字人的打断体验。
双讲检测做得不好,用户会发现自己明明在说话,系统却听不见;
或者每次打断数字人,都要提高音量才能触发。
六、残余回声抑制:为什么消除后仍可能有尾音?
自适应滤波通常无法百分之百去掉所有回声。
尤其在复杂房间、多扬声器、大屏外放、网络抖动等情况下,麦克风里仍可能残留一些尾音。
所以AEC后面通常还会增加残余回声抑制,也叫RES。
它的作用是继续判断剩余声音中,哪些部分仍然像数字人播放内容,并进一步降低这些声音。
不过,抑制强度不能过高。
如果处理太重,用户声音可能变得断断续续,听起来像被切掉;
如果处理太轻,又可能留下明显回声。
所以企业级数字人系统需要在“去回声”和“保留自然语音”之间找到平衡。
七、AEC为什么要和VAD、降噪一起使用?
AEC通常不是独立工作的。
完整的实时语音前处理链路,通常包括:
AEC回声消除,去掉数字人自己播放的声音;
NS噪声抑制,降低空调、音乐、人群等背景噪声;
AGC自动增益控制,调整用户声音大小;
VAD语音活动检测,判断用户是否正在说话。
这些模块的处理顺序和参数配置非常重要。
如果回声没有先消除,VAD可能被数字人自己的声音触发;
如果降噪太强,用户声音可能被削弱;
如果增益过高,又可能把剩余回声重新放大。
所以真正稳定的语音交互,不是打开几个功能开关就行,而是要根据官网、展厅、会议室和移动端等不同场景单独调试。
八、企业如何测试数字人的回声消除能力?
企业测试AI数字人时,可以使用几种简单方式。
让数字人提高音量连续说话,观察是否会误触发识别;
在数字人回答过程中直接插话,看系统能否听到用户;
把麦克风靠近扬声器,观察是否出现重复回答;
在玻璃较多或空间较大的房间测试;
分别测试电脑、手机、平板和展厅设备。
测试时不能只看数字人是否能回答,还要观察:
是否会把自己的声音当成用户声音;
是否会突然停止播报;
用户打断时是否能被识别;
连续对话中是否出现重复触发。
这些测试能比较真实地反映AEC是否可用。
九、金福来数字人的实时语音体验,离不开AEC技术
对企业来说,金福来数字人要真正用于官网接待、展厅讲解、培训问答和客户服务,就不能只关注形象、声音和口型。
实时语音交互还需要解决一个基础问题:
数字人说话时,能不能继续准确听用户,而不会听见自己。
这背后依赖AEC回声消除、双讲检测、残余回声抑制、VAD和降噪等多项音频技术。
这些能力处理得越稳定,数字人在真实环境中的误触发越少,用户打断也会更加自然。
结语
AI数字人出现自己打断自己、重复回答或误触发,不一定是大模型出了问题,也不一定是语音识别能力差。
很多时候,真正的问题是麦克风收到了数字人自己的声音。
AEC回声消除负责识别并削弱这部分声音;
自适应滤波负责适应不同房间;
双讲检测负责保留用户插话;
残余回声抑制负责清理剩余尾音。
真正自然的AI数字人,不只是能够开口回答,还要做到:
自己说话时,不把自己当成用户;用户插话时,又能够及时听见。

