OpenAI现场演示翻车?GPT-5发布会现神图,奥尔特曼自嘲:图表重大失误
2025/08/08 06:48AI云资讯12603

(AI云资讯消息)在北京时间8月8日凌晨举行的GPT-5重磅直播发布会上,OpenAI展示的多组数据图表看似彰显了模型的卓越性能,但细看之下,部分图表却出现了令人啼笑皆非的乌龙。
最具讽刺意味的是一张展示各模型欺骗评估表现的图表:纵坐标刻度混乱不堪。例如在代码欺骗指标中,现场演示显示GPT-5思考版取得50.0%的欺骗率,但对比参照的OpenAI自家o3小模型47.4%的数值时,o3小模型柱状图反而显示更长。有趣的是,OpenAI在官方博客中公布的准确数据显示,GPT-5实际欺骗率应为16.5%。
在这张引发争议的图表中,OpenAI现场演示出现了一个明显悖论:GPT-5某项评分明明低于o3模型,对应的柱状图却显示更长。更离谱的是,o3与GPT-4o的评分数值不同,图表中却呈现为等长柱状。如此严重的可视化失误,连CEO萨姆·奥尔特曼都忍不住吐槽这是史诗级图表翻车,不过他随即澄清官网博客已发布正确版本。
目前,OpenAI尚未就此事置评。虽然尚不确定这些图表是否由GPT-5生成,但在新品发布的重要时刻出现如此纰漏,对公司形象着实不利,尤其当OpenAI正大力宣传其新模型在减少幻觉方面取得重大突破之际,这样的失误显得格外讽刺。
相关文章
- 英伟达百亿押注OpenAI算力基地,潜在回报或达两千亿美元
- OpenAI的Bel模型参数突破10万亿,或成全球首个AGI门槛级基座
- OpenAI公布安全升级方案,避免安全事故重演
- IPO前夕,OpenAI解散安全预备团队
- OpenAI一周内连失两位核心高管:首席营收官继首席运营官离职后也提出请辞
- OpenAI总裁:将为 AI 聊天机器人打造全系硬件产品矩阵
- 英伟达与微软牵头成立开放AI安全联盟,OpenAI、谷歌及Anthropic均未加入
- OpenAI推出ChatGPT Health,AI将重塑医疗
- 微软拟在Copilot中用月之暗面Kimi K3替换OpenAI和Anthropic的模型,有望节省6亿美元
- OpenAI推出专为Codex打造的配套硬件产品
- OpenAI有望在今年推出搭载ChatGPT的智能音箱
- 苹果起诉OpenAI涉嫌窃取硬件机密
- OpenAI推出GPT-5.6,并宣布推出AI智能体ChatGPT Work
- OpenAI发布GPT-Live-1大模型,智能语音模式全面升级
- OpenAI与Work Louder合作,将推出专为Codex打造的硬件设备
- OpenAI推出首款自研AI推理芯片Jalapeño,专为处理 ChatGPT 请求的服务器设计
AI企业
更多>>AI硬件
更多>>- 华硕 ProArt 创梦 27 OLED:以 4K QD-OLED 与专业色彩表现,支持精细化创作
- 芯展速 Gen 6 Retimer 正式上市,副总裁李蓁 ODCC大会演讲官宣 获媒体热议
- 行业首款60℃热雾巨无霸滚筒扫拖旗舰!iRobot Roomba 875发布,重新定义扫地机器人清洁力
- 华硕主板助国产颗粒内存达成四槽满插6000C30与双条8000C36双重突破
- 首日销量突破600台!8888元的元点机器人Bridge正在赢得开发者
- 三星半导体亮相2026首届算博会,以创新存储方案赋能智能体AI
- 开学季提升成绩 入手三星Galaxy Tab S10 FE|Tab S10 FE+正合适
- 骁龙本阵营再添新成员,华硕灵耀 14 骁龙版打造新锐 AI PC 轻薄本首选
AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









