不识字也能翻译:谷歌AI直接用音频翻音频,不用先转文本
2019/04/17 11:08AI云资讯11634
在我们的世界里,谷歌翻译是这样的:
一直被调戏的翻译娘
在谷歌的世界里,谷歌翻译是这样的:
西语英语:你不问,就不会知道了
请注意,视频里的文字只是为了便于观赏,才存在的。
而AI在翻译语音的时候,不把西语的音频转成文本,也不生成任何英语的文本,直接产出了英文音频。和标答一字不差。
这是谷歌团队的最新成果,想法大胆而有效。

仿佛在双语环境里出生的小朋友,还没识字,就能把爸爸说的话翻译给妈妈。
怎么会不用看文本?
这个翻译模型,名字叫做S2ST(全称Speech-to-Speech Translation) 。
不看文本只靠听,背后的原理是把一种语音的声谱图(Spectrogram) ,映射到另一种语音的声谱图上。
那么,声谱图什么样?
下图就是 (西语) “你好么,嘿,我是威廉,你怎么样啊?”的声谱图。
横轴是时间,纵轴是Mel频率
然后是目标,英文的声谱图。
AI只要从大量的成对数据里,学懂英文和西语的声谱映射关系,就算不识别人类说的是什么字,依然能当上翻译员。
当然,一个完整的翻译模型,并没有上面说的这么简单,它由三个部分组成:
一是基于注意力的序列到序列 (seq2seq) 神经网络。就是下图的蓝色部分,它负责生成目标声谱图,这只是第一步,还不是音频;
二是一个声码器(Vocoder) 。下图的红色部分,它会把声谱图转换成时域波形 (Time-Domain Waveforms) ,这已经是带有时间顺序的正经声波了;
三是个可选的附加功能,原本说话人的编码器。绿色部分,经过它的加工,翻译出的英文,和原本的西语,听上去就像同一个人发出来的。

当然,蓝色部分还是主角。
里面的编码器 (左) ,是8层双向LSTM堆起来的;而解码器 (Spectrogram Decoder) ,团队说要选4-6层LSTM的,深一点效果比较好。
成功了
模型是用人类自发的对话 (比如打电话的语音) 端到端训练出来的,一起来看看成果吧。
第一题,短语。“克兰菲尔德大学的新员工”,翻译和标答一字不差。
原文:nuevos empleados de Cranfield University
标答:New hires at Cranfield University
第二题,句子。“看看这个国家上下,你看到了什么”,依然和标答一致。
原文:Por lo tanto, mirar alrededor del país y lo que ves.
标答:So, look around the country and whatdoyou see?
对手表现怎样?借助转换文本来翻译的AI,缺了个“do”字:

第三题,带从句的句子。“我的表 (堂) 兄弟姐妹们小的时候,我照顾过他们也教过他们,有过一些这样的经历。”
原文:Tengo cierta experiencia en cuidar y ense?ar a mis primos cuando eran jóvenes.
标答:I’ve got some experience in looking after and teaching my cousins when they were young.
照顾(TakingCare of) 有缺失,其他部分对比标答是完整的。
再看对手,“照顾 (Care) ”和“教 (Teach) ”都用了动词原形,语法不是很严格:

肉眼看过之后,再让S2ST和先转换文本再翻译的AI对比一下BLEU分。
在“Conversational”大数据集上,S2ST的BLEU分比对手差了6分:42.7比48.7。

的确还有一些差距,但毕竟对手依靠了文本,算是开卷考了。
这样说来,直接跳过文本的想法,虽然听起来有些飘,但结果证明是可行的。
所以,谷歌团队说,大有可为啊。
相关文章
- 翻译只是起点:讯飞AI眼镜的AI助理能力全面拆解
- 依托自研同传大模型 讯飞 AI 翻译耳机重塑专业翻译新标准
- 亮亮视野AR+AI会议翻译系统亮相世界物联网500强峰会,让每位嘉宾都能看到自己的语言
- 主流媒体聚焦亮亮视野Hey2,AR翻译眼镜在MWC上海展现应用价值
- 传音Hi Translate 6.0 升级发布:从翻译工具进化为“多语言智能体“
- 网易有道27B开源小模型直接登顶!技术大V:语音克隆功能超强,翻译后毫无外语口语
- 打造连接人类世界与硅基世界的“翻译器”,华为云码道用户数突破十万
- 抛弃翻译、提词、导航:AI眼镜开启“减法革命”
- 2026中国翻译协会年会召开,科大讯飞携多语言AI翻译产品矩阵亮相并获评5A级企业认证
- 便携翻译机进入“端侧智能时代”,时空壶新T1凭离线技术构筑核心壁垒
- 准儿翻译机5.0成企业出海沟通利器,分音塔科技以AI翻译赋能跨国商务
- 博雅翻译集团斩获国际翻译协会质量金奖 树立行业新标杆
- 讯飞翻译机登陆MWC 2026,同传级沟通体验,多语种交流无压力
- 端侧模型颠覆离线翻译时空壶新T1让出海旅游“无网也精准”
- 趣丸千音作为AI视频翻译官,亮相36氪WISE 2025商业之王大会
- 科大讯飞AI翻译亮相2025企业家博鳌论坛,助力全球智慧无缝交融
AI企业
更多>>AI硬件
更多>>- 联合开源!因时机器人携手上海交大、复旦发布HandEdit数据集与评测基准
- 华沿机器人与骅升科技达成战略合作,携手布局具身智能与协作机器人市场
- 元点机器人Bridge斩获IFA年度创新奖,全球首款AI原生人形机器人柏林首秀
- 华硕 ProArt 创梦 27 OLED:以 4K QD-OLED 与专业色彩表现,支持精细化创作
- 芯展速 Gen 6 Retimer 正式上市,副总裁李蓁 ODCC大会演讲官宣 获媒体热议
- 行业首款60℃热雾巨无霸滚筒扫拖旗舰!iRobot Roomba 875发布,重新定义扫地机器人清洁力
- 华硕主板助国产颗粒内存达成四槽满插6000C30与双条8000C36双重突破
- 首日销量突破600台!8888元的元点机器人Bridge正在赢得开发者
AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









