OpenAI和DeepMind AI系统在Pong和Enduro实现了“超人”的表现
2018/11/22 09:50AI云资讯11323
通过观看人类来玩游戏的机器学习可能听起来像科幻小说的情节,但这正是OpenAI的研究人员以及谷歌子公司DeepMind声称已经完成了。 OpenAI这是一个由Elon Musk,Reid Hoffman和Peter Thiel支持的非营利性,总部位于旧金山的人工智能研究公司。
该研究已提交给神经信息处理系统(NIPS 2018),该系统计划于12月的第一周在加拿大蒙特利尔举行。
“为了通过强化学习解决复杂的现实问题,我们不能依赖手动指定的奖励功能,”该团队写道。“相反,我们可以让人类直接向代理人传达目标。”
这是一种在先前的研究中被称为“逆强化学习”的技术,它对于涉及定义不明确的目标的任务有希望,这些目标往往会绊倒人工智能(AI)系统。正如该论文的作者所指出的那样,强化学习 - 使用奖励(或惩罚)系统来驱动AI代理人实现特定目标 - 如果所讨论的目标缺乏反馈机制,则没有多大用处。
由研究人员的AI模型创建的游戏代理不仅模仿人类行为。如果他们有,他们就不会具有特别的可扩展性,因为他们需要一个人类专家来教他们如何执行特定任务,而且永远不会能够比所述专家实现“显着”更好的性能。
研究人员的系统结合了多种形式的反馈,包括来自专家演示的模仿学习和使用轨迹偏好的奖励模型。基本上,它没有假设直接可用的奖励,例如分数增加或游戏内奖金;相反,依靠循环中人类的反馈,它试图通过(1)模仿示范和(2)最大化推断的奖励函数来尽可能接近预期的行为。
该模型由两部分组成:深度Q-Learning网络,DeepMind在先前的研究中用于实现Atari 2600游戏中的超人表现,以及奖励模型,一种卷积神经网络,由注释器提供的标签训练 - 无论是人还是合成系统 - 在任务培训期间。
代理人随着时间的推移从示威和经验中学到了知识。人类专家一直阻止他们利用可能损害绩效的意外奖励来源,这种现象称为奖励黑客。
在测试中,研究人员在Arcade学习环境中设置AI模型的代理,这是一个开源框架,用于设计可以玩Atari 2600游戏的AI代理。研究人员写道,Atari游戏具有“强化学习中最多样化的环境”的优势,并提供“明确的”奖励功能。
经过5000万步骤和6,800个标签的完整时间表,受过研究人员系统训练的代理人在所有测试的游戏中都超越了模拟学习基线,除了私人眼睛(包括Beamrider,Breakout,Enduro,Pong,Q * bert和Seaquest)。研究人员发现,人类示威活动使Hero,Montezuma's Revenge和Private Eye受益匪浅,并且通常将实现相同性能水平所需的人工时间减半。
这项研究紧随人工智能系统 - 也是OpenAI科学家的工作 - 在Montezuma的复仇中可以成为最佳人类。(该模型的大多数性能改进来自随机网络蒸馏,它引入了奖励奖励,该奖励基于预测下一个状态下固定和随机初始化神经网络的输出。)当在超级马里奥上设置松散时,由系统训练的代理发现了11个关卡,找到了秘密房间,并击败了老板。当他们在Pong与一名人类球员一起打球时,他们试图延长比赛而不是赢球。
6月份OpenAI开发的机器人可能会击败Valve的Dota 2中的技术团队。

该研究已提交给神经信息处理系统(NIPS 2018),该系统计划于12月的第一周在加拿大蒙特利尔举行。
“为了通过强化学习解决复杂的现实问题,我们不能依赖手动指定的奖励功能,”该团队写道。“相反,我们可以让人类直接向代理人传达目标。”
这是一种在先前的研究中被称为“逆强化学习”的技术,它对于涉及定义不明确的目标的任务有希望,这些目标往往会绊倒人工智能(AI)系统。正如该论文的作者所指出的那样,强化学习 - 使用奖励(或惩罚)系统来驱动AI代理人实现特定目标 - 如果所讨论的目标缺乏反馈机制,则没有多大用处。
由研究人员的AI模型创建的游戏代理不仅模仿人类行为。如果他们有,他们就不会具有特别的可扩展性,因为他们需要一个人类专家来教他们如何执行特定任务,而且永远不会能够比所述专家实现“显着”更好的性能。
研究人员的系统结合了多种形式的反馈,包括来自专家演示的模仿学习和使用轨迹偏好的奖励模型。基本上,它没有假设直接可用的奖励,例如分数增加或游戏内奖金;相反,依靠循环中人类的反馈,它试图通过(1)模仿示范和(2)最大化推断的奖励函数来尽可能接近预期的行为。
该模型由两部分组成:深度Q-Learning网络,DeepMind在先前的研究中用于实现Atari 2600游戏中的超人表现,以及奖励模型,一种卷积神经网络,由注释器提供的标签训练 - 无论是人还是合成系统 - 在任务培训期间。
代理人随着时间的推移从示威和经验中学到了知识。人类专家一直阻止他们利用可能损害绩效的意外奖励来源,这种现象称为奖励黑客。
在测试中,研究人员在Arcade学习环境中设置AI模型的代理,这是一个开源框架,用于设计可以玩Atari 2600游戏的AI代理。研究人员写道,Atari游戏具有“强化学习中最多样化的环境”的优势,并提供“明确的”奖励功能。
经过5000万步骤和6,800个标签的完整时间表,受过研究人员系统训练的代理人在所有测试的游戏中都超越了模拟学习基线,除了私人眼睛(包括Beamrider,Breakout,Enduro,Pong,Q * bert和Seaquest)。研究人员发现,人类示威活动使Hero,Montezuma's Revenge和Private Eye受益匪浅,并且通常将实现相同性能水平所需的人工时间减半。
这项研究紧随人工智能系统 - 也是OpenAI科学家的工作 - 在Montezuma的复仇中可以成为最佳人类。(该模型的大多数性能改进来自随机网络蒸馏,它引入了奖励奖励,该奖励基于预测下一个状态下固定和随机初始化神经网络的输出。)当在超级马里奥上设置松散时,由系统训练的代理发现了11个关卡,找到了秘密房间,并击败了老板。当他们在Pong与一名人类球员一起打球时,他们试图延长比赛而不是赢球。
6月份OpenAI开发的机器人可能会击败Valve的Dota 2中的技术团队。
相关文章
- OpenAI GPT‑6 Astra 催生海量本地 CPU 智能体,为英特尔与 AMD 带来需求红利
- 受 Hugging Face 遭黑客攻击事件影响,OpenAI 推迟新模型研发
- 英伟达百亿押注OpenAI算力基地,潜在回报或达两千亿美元
- OpenAI的Bel模型参数突破10万亿,或成全球首个AGI门槛级基座
- OpenAI公布安全升级方案,避免安全事故重演
- IPO前夕,OpenAI解散安全预备团队
- OpenAI一周内连失两位核心高管:首席营收官继首席运营官离职后也提出请辞
- OpenAI总裁:将为 AI 聊天机器人打造全系硬件产品矩阵
- 英伟达与微软牵头成立开放AI安全联盟,OpenAI、谷歌及Anthropic均未加入
- OpenAI推出ChatGPT Health,AI将重塑医疗
- 微软拟在Copilot中用月之暗面Kimi K3替换OpenAI和Anthropic的模型,有望节省6亿美元
- OpenAI推出专为Codex打造的配套硬件产品
- OpenAI有望在今年推出搭载ChatGPT的智能音箱
- 苹果起诉OpenAI涉嫌窃取硬件机密
- OpenAI推出GPT-5.6,并宣布推出AI智能体ChatGPT Work
- OpenAI发布GPT-Live-1大模型,智能语音模式全面升级
AI企业
更多>>AI硬件
更多>>- 联合开源!因时机器人携手上海交大、复旦发布HandEdit数据集与评测基准
- 华沿机器人与骅升科技达成战略合作,携手布局具身智能与协作机器人市场
- 元点机器人Bridge斩获IFA年度创新奖,全球首款AI原生人形机器人柏林首秀
- 华硕 ProArt 创梦 27 OLED:以 4K QD-OLED 与专业色彩表现,支持精细化创作
- 芯展速 Gen 6 Retimer 正式上市,副总裁李蓁 ODCC大会演讲官宣 获媒体热议
- 行业首款60℃热雾巨无霸滚筒扫拖旗舰!iRobot Roomba 875发布,重新定义扫地机器人清洁力
- 华硕主板助国产颗粒内存达成四槽满插6000C30与双条8000C36双重突破
- 首日销量突破600台!8888元的元点机器人Bridge正在赢得开发者
AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









