准确率提高9.5%!亚马逊Alexa推出新语音识别系统
2019/04/02 16:18AI云资讯11522

在语音识别方面,两个麦克风比一个麦克风更好,这是一个公认的事实。直观的说,这是有一定道理的:声波到达多个麦克风的时间延迟不同,这可以用来提高来自某个方向的信号的强度,同时减少来自其他方向信号的干扰。传统上,语音增强(将语音从噪声中分离出来)的问题一直是独立于语音识别来解决的,但是相关实验结果表明,这种方法所取得的效果并不太好。最近,亚马逊研究人员对此提出了自己的解决办法。
亚马逊Alexa部门的研究人员认为,他们已经开发出一种新的声学建模框架,通过统一语音增强和语音识别来提高性能。在实验中,当应用2-mic系统时,他们声称他们的模型比使用传统的7-mic系统提高了9.5%的语音识别准确率。
他们在两篇论文中描述了自己的工作成果,“频域多通道声学模型用于远程语音识别”和“多几何空间声学模型用于远程语音识别”,这两篇论文将于下月在布莱顿举行的第44届ICASSP国际声学、语音与信号处理会议上发表。
研究人员在论文中描述了一种多麦克风系统方法,它取代了独立的手工编码算法,这些算法确定波束形成器(在传感器输出上工作的空间滤波器,以增强波的幅度)的方向,并用单个神经网络识别语音信号。亚马逊目前的Echo音箱可以动态调整波束形成器,以适应新的声学环境。

Alexa语音组的语音科学家Kenichi Kumatani在一篇博客文章中解释道:“传统技术旨在将单个声束指向任意方向,但这是一种计算密集型的方法。” “有了Echo智能音箱,我们可以将多个声束指向不同的方向,并识别出产生最清晰语音信号的那一个……这就是为什么即使电视在几码外发出刺耳的声音,Alexa依然可以理解你对要求播报天气预报的指令。”
单个神经网络和传统模型都将波束形成器的输出以对数滤波器组能量的形式传递给特征提取器,或者以多个不规则频带的信号能量快照的形式传递给特征提取器。在传统的模型中,它们对背景噪声进行标准化估算,提取器的输出被传递给一个人工智能系统,该系统计算出不同“电话”(即语音信息的短单位)对应的特征的概率。
论文的作者表示,如果模型的每个组件(例如,特征提取器和波束形成器优化器)分别初始化,性能就会提高。他们同时补充到,不同的训练数据使模型能够跨设备处理各种类型和配置的麦克风。Kumatani说:“这意味着新设备的ASR(自动语音识别技术)系统,或者使用范围不太广泛的设备,都可以从更广泛使用的设备产生的交互数据中受益。”
相关文章
- 一架亚马逊货机在迈阿密国际机场坠毁
- 出海包裹容易丢?三态速递适配亚马逊FBM 全链路服务,物流可追踪降低履约风险
- 从亚马逊AWD入仓规则调整,看AI智能硬件出海的供应链重构
- 亚马逊拟于2028年推出全球卫星手机网络
- AI 时代的统一多云监控:ManageEngine 卓豪ITOM参加2026年亚马逊云科技中国峰会
- 合合信息一季度财报营收同比增27.53%,联手亚马逊云科技落地多模态文档智能体
- 一句话完成合同审批全流程,合合信息联合亚马逊云科技打造多模态文档智能体
- 中科天机国际版上线,登上亚马逊提供全球高精度气象数据
- 亚马逊数据中心公布2025年水消耗量为946万吨
- 亚马逊发布Proteus智能机器人,自动化升级伴随大规模裁员潮
- 亚马逊250亿加盟豪掷Anthropic,微美全息深耕Agent与AIGC赛道拓版图!
- 亚马逊以115亿美元收购全球星公司,苹果却成为这场交易的赢家
- 卖家精灵火热亮相福州跨交会,展示亚马逊+TikTok双平台解决方案!
- 全球首创双目技术加持,MOVA ViAX登顶亚马逊智能割草机销量榜首
- OpenAI宣布获得亚马逊、英伟达和软银新融资1100亿美元
- 亚马逊广告发布2026年全球营销趋势洞察
AI企业
更多>>AI硬件
更多>>- 联合开源!因时机器人携手上海交大、复旦发布HandEdit数据集与评测基准
- 华沿机器人与骅升科技达成战略合作,携手布局具身智能与协作机器人市场
- 元点机器人Bridge斩获IFA年度创新奖,全球首款AI原生人形机器人柏林首秀
- 华硕 ProArt 创梦 27 OLED:以 4K QD-OLED 与专业色彩表现,支持精细化创作
- 芯展速 Gen 6 Retimer 正式上市,副总裁李蓁 ODCC大会演讲官宣 获媒体热议
- 行业首款60℃热雾巨无霸滚筒扫拖旗舰!iRobot Roomba 875发布,重新定义扫地机器人清洁力
- 华硕主板助国产颗粒内存达成四槽满插6000C30与双条8000C36双重突破
- 首日销量突破600台!8888元的元点机器人Bridge正在赢得开发者
AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









