中国高校结合语音和面部数据让人工智能“察言观色” 准确率高达62%
2019/01/17 17:27AI云资讯10955

一些人工智能研究人员长期以来的一个目标是,开发出一种系统,可以仅根据人的语音和面部抽搐来对人的情绪进行分类。像Affectiva这样的公司正在朝着这一方向发力。该公司最近推出了一款产品,可以通过扫描驾驶员的面部和声音来监控他们的情绪。但由于语言和肌肉运动的细微差别,仍存在相当大的挑战。
不过,中国科学技术大学的研究人员声称已取得进展。本周在预印本服务器Arxiv.org上发表的一篇论文中,他们描述了一个人工智能系统,该系统能够在流行基准上以最高水平的精度识别一个人的情感状态。
“自动情感识别(AER)是一项具有挑战性的任务,因为它具有抽象的概念和多种情感表达方式。”他们写道, “受到人类认知过程的启发,自然而然地在AER中同时利用音频和视觉信息......整个管道可以在神经网络中完成。”
该团队的AI系统的一部分包括音频处理算法,通过语音频谱图(声音频率随时间变化的视觉展示)作为输入,帮助整个AI模型回归与情感最相关的区域。第二个组件通过两个计算层运行人脸视频帧:一个基本的人脸检测算法和三个“最先进的”人脸识别网络“微调”,使它们与“情绪相关”。这是一个比起听起来更棘手的事情 - 正如论文的作者所指出的,并非所有的框架都对情绪状态有同等作用,因此他们不得不实施一种能够突显重要框架的注意机制。
在从所有四种面部识别算法中提取特征(即,可测量的特征)之后,它们与语音特征融合以“深度捕捉”它们之间的关联,用于最终的情绪预测。这是最后一步。
为了“教会”人工智能模型对情绪进行分类,该团队输入了AFEW8.0提供的653视频和相应音频片段。AFEW8.0是一个电影和电视节目数据库,用于EmotiW2018的音视频子挑战。它坚持自己的观点,在383个样本的验证集中,成功地从7个选项中对情绪进行分类——“愤怒”、“厌恶”、“恐惧”、“快乐”、“中立”、“悲伤”和“惊讶”——准确率约为62.48%。此外,研究人员证明其视频帧分析受音频信号的影响;换句话说,人工智能系统在进行预测时考虑了语音和面部表情之间的关系。
也就是说,当模型与“厌恶”、“惊讶”和其他“弱”表情或容易与其他情绪混淆的情绪作斗争时,模型倾向于表现出“明显”特征的情绪,如“愤怒”、“快乐”和“中立”。尽管如此,它的性能几乎与之前使用五种视觉模型和两种音频模型的方法相当。
“与最先进的方法相比,”研究人员写道,“[我们]提出的方法可以用单一模型获得可比较的结果,在多个模型上取得新的里程碑。”
相关文章
- 科密推出吸顶式新品,语音防护升级为“融入整个空间”
- IOTE深圳站|多技术融合加速智能交互升级,唯创知音携语音、显示、感知等多款新品亮相
- Moxy摸喜亮相WRC展:告别语音内卷 纯触觉交互机器人能否开辟AI陪伴新赛道?
- 百融智能:语音将成为全域人机交互终极入口
- 天禧AI妙记为联想旗舰店上海环球港开业再添“超能力,语音文字图片同步整理
- 传音TEX AI语音算法团队斩获MLC-SLM 2026国际挑战赛Task 1亚军
- 断网不断智,离线即强大:鱼亮科技全链路边缘语音赋能具身智能
- OpenAI发布GPT-Live-1大模型,智能语音模式全面升级
- 语音泄密风险常态化,科密全场景方案适配多类B端机构防护需求
- 网易有道27B开源小模型直接登顶!技术大V:语音克隆功能超强,翻译后毫无外语口语
- 告别泄密风险!新规合规窗口期,科密销毁+语音双防护守护企业核心资产
- 鸿蒙版微博更新!评论区支持听语音、发多图,服务卡片内容更丰富
- 偷录音可成为合法证据!语音保密刻不容缓
- Soul App开源SoulX-Duplug模块,探索更自然的全双工语音交互路径
- Soul App联合高校开源SoulX-Duplug,推动全双工语音对话能力落地
- 羽乐科技发布新一代AI智能语音质检平台:全链路AI深度赋能业务合规与增长
AI企业
更多>>AI硬件
更多>>- 努比亚NaviX Ultra定档9月16日,全球首款AI智能体手机即将上市
- BOE(京东方)新一代TSF广色域显示技术斩获德国IFA 2026金奖 重塑OLED柔性显示画质性能新标准
- 元点机器人卖出了1000台具身智能,“8888元+高性能”引发行业热议
- 联合开源!因时机器人携手上海交大、复旦发布HandEdit数据集与评测基准
- 华沿机器人与骅升科技达成战略合作,携手布局具身智能与协作机器人市场
- 元点机器人Bridge斩获IFA年度创新奖,全球首款AI原生人形机器人柏林首秀
- 华硕 ProArt 创梦 27 OLED:以 4K QD-OLED 与专业色彩表现,支持精细化创作
- 芯展速 Gen 6 Retimer 正式上市,副总裁李蓁 ODCC大会演讲官宣 获媒体热议
AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









