受发展心理学启发,研究员开发出能预测物体运动的AI模型
2020/02/28 17:41AI云资讯11233
人类可以轻松地识别事物并对其行为进行推理,这是我们认知发展的核心。即使是儿童,他们也会根据物体动态对其进行细分,并用持久性、稳定性、连续性的概念来解释物体发生了什么,以及推测在其他情况下物体会发生什么。
受此启发,为了简化人工智能模型的视觉识别问题,来自麻省理工学院-IBM Watson人工智能实验室、麻省理工学院计算机科学与人工智能实验室、DeepMind和哈佛大学的一组研究人员引入了一套动态视频推理基准——CLEVRER,并开发出了一套能预测物体运动的模型。
CLEVRER包含了由物理引擎生成的2万多个时长为5秒的碰撞物体视频,每个视频里包含了三种形状、两种材料和八种颜色。同时还包括30多万个问题和答案。这些视频和问题全部都集中在逻辑推理的四个要素上:描述,什么颜色;说明,什么原因造成;预测,接下去会发生什么;反事实,如果发什么。

模型运行示意图
通过解析CLEVRER,研究人员确定了在描述性、解释性、预测性和反事实性问题上,训练AI模型需要的内容,分别是:对物体、事件之间的运动、因果关系,以及背后的逻辑关系进行推理的符号描述。随后,研究人员据此开发了神经符号动态推理模型(NS-DR)。
这个模型实际由四个部分合成。分别是:视频帧解析器,神经动态预测器,问题解析器和符号程序执行器。给定输入视频,视频帧解析器会检测场景中的对象并提取其轨迹和属性(即位置,颜色,形状,材质)。形成视频的抽象描述后,将其发送到神经动态预测器以预测对象的运动和碰撞。问题解析器接收输入问题以获得代表其逻辑的功能程序。然后,符号程序执行器在动态场景上运行该程序并输出答案。
根据该团队报告,在用1000个程序应用了该模型后,他们的模型对问题的识别准确率达到了88.1%,优于其他基准模型。在解释性,预测性和反事实性问题上,则有更好的表现。
研究人员指出:“ NS-DR 将动态规划纳入视觉推理任务中,可以直接预测未观察到的运动和事件,并可为预测性和反事实性任务启用。其次,符号描述为视觉,语言,动力和因果关系提供了强大的基础。通过设计,它使模型能够明确捕捉视频的因果结构和问题背后的逻辑构成。”
不过,研究人员也承认,即便训练所需的数据量相对较少,但模型在实际应用中仍很难使用。此外,在需要长期动态预测的任务(例如反事实问题)上,NS-DR的性能也没有那么高,这表明未来仍需要一种能够生成更稳定和准确轨迹的动态模型。
相关文章
- 忆联Gen5 QLC AE631即将面市:性能看齐TLC,唤醒本地AI算力
- AI体验+视频下载增强+工具箱 华为浏览器焕新适配暑期场景
- 华为云与滴普科技联合发布数据智能解决方案,加速制造与零售行业AI落地
- “智天哨兵”出战 全国首个AI无人机巡检落地湖北襄阳
- 权威认可!浪潮数据双重收获:参编AI云基础设施系列标准,助力东营算力中心入选2026可信云创新应用实践
- 动码印章携全系列AI智能印控解决方案登陆全球商业创新大会
- 助力企业 AI 落地,南凌科技「智枢 AI 网关」让大模型接得快、用得稳、看得见、算得清
- 战略转型全面落地丨卓特视觉新版官网焕新上线,构建数创协同的 AI 服务新底座
- 数据管理国标“天花板”!百度胜算拿下AI云首张五级通行证
- AI 赋能 “机器管”,三亚市阳光招采服务平台正式上线运行
- 维谛技术(Vertiv):电冷耦合重构算力底座 筑牢AI算力新底座
- 中电金信:中国银行业IT解决方案领跑者,以全栈AI与数字底座驱动金融数字化转型
- 跻身 IDC MarketScape领导者!中关村科金以企业级 AI 全栈能力赋能千行百业
- 聚力AI创新,赋能千行百业!AI Show 2026杭州人工智能与机器人展将于9月9日启幕
- 蚂蚁集团领投,老股东超额跟投加注,戴盟两月内连获数亿元融资,以全栈触觉能力破局物理AI
- 驾驭AI,数智融合新底座|用友BIP技术峰会圆满举行
AI企业
更多>>AI硬件
更多>>- 联合开源!因时机器人携手上海交大、复旦发布HandEdit数据集与评测基准
- 华沿机器人与骅升科技达成战略合作,携手布局具身智能与协作机器人市场
- 元点机器人Bridge斩获IFA年度创新奖,全球首款AI原生人形机器人柏林首秀
- 华硕 ProArt 创梦 27 OLED:以 4K QD-OLED 与专业色彩表现,支持精细化创作
- 芯展速 Gen 6 Retimer 正式上市,副总裁李蓁 ODCC大会演讲官宣 获媒体热议
- 行业首款60℃热雾巨无霸滚筒扫拖旗舰!iRobot Roomba 875发布,重新定义扫地机器人清洁力
- 华硕主板助国产颗粒内存达成四槽满插6000C30与双条8000C36双重突破
- 首日销量突破600台!8888元的元点机器人Bridge正在赢得开发者
AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









