人工智能图像生成技术:短短5年内如何飞速发展?
2021/04/03 09:33AI云资讯11328

图源:unsplash
OpenAI曾创建出一些AI行业最具未来感的技术,并因此而享誉盛名。这一研究机构获得了微软的支持,现由Y Combinator创始人Sam Altman领导,以其强大的文本生成器GPT-3而闻名。
在过去几年内,该机构还制造出一只可以通过自学还原魔方的机器手、一组超人电子竞技算法、一种合理生成人类音乐的算法,以及多种可以玩游戏和使用工具学习复杂策略的算法。
近期,OpenAI发布了DALL-E,一个可以根据书面文本生成图像的人工智能系统。例如,系统响应提词“一个牛油果形状的皮包。一个仿造牛油果样式的皮包”,可以产生几十次关于牛油果皮包的迭代。

图源: OpenAI
该公司还未将DALL-E(Salvador Dalí和WALL-E名字的结合)公之于众,甚至也尚未邀请其特定开发者群体来试用新软件,但据其网站上的案例所示,该系统可以创建极其逼真且细致的图像。
DALL-E精通各种艺术风格,包括插图和风景画。它还可以生成文本,在建筑物上进行标记,并将同一场景的素描线条和全彩图像分离。研究人员把这种影响深远的能力称为泛化能力,即算法并非专门针对某一种任务或艺术风格。
OpenAI将算法的神通广大归功于两个主要因素:其一,算法非常庞大。它使用了120亿个参数,数量大到令人惊异。而这些参数可以被认为是算法转动的旋钮,用来调整其理解想法的方式。这120亿个参数在分析图像和文本时能够分辨出诸多特异性,令人难以置信。
然后,这些图像和文本材料被输入到算法中,并且被翻译成更易于算法理解的标记或文本。OpenAI解释说,一个标记就像英语字母表中的一个字母——它们代表碎片化的概念,这一方式更易于机器计算,并且以它们以算法的语言模式排列。
这一机器字母表包含16384个文本标记和8192个图像标记。这种将人类可读文本自动转换为机器可读文本的方法称为“转换器模型”。一个字幕或带有文本的图像转换为算法,最多会被翻译成256个标记,而图像最多能被翻译成1024个标记。这使得算法能够为相对较少的文本输入匹配到更复杂的图像。
之后,算法将通过分析成对的图像和字幕不断进化。通过表面上数百万次迭代,它能够将文本片段与图像的特定特征联系起来。但OpenAI还未公布这一数据集的容量或其包含的图像内容。
该公司并不是第一个尝试从文本中生成图像的公司,甚至这也不是OpenAI的首次尝试。这只是此类算法的最新版本,似乎也是最可行的一个版本。虽然该公司还未发表过任何文章来描述该系统,但这一算法的创造者确实曾在其博客上引用了DALL-E的前置任务。
通过对算法的沿袭进行考察,我们可以追踪到这项技术实际上的发展程度。
2016
OpenAI引用了这篇由密歇根大学和马普研究所撰写的论文,为当前文本到图像生成的研究注入了活力。
这篇论文使用了生成式对抗网络(generative adversarial networks generative,简称GANs)来生成图像。GANs的功能是将两种算法相互对立:一种生成图像,另一种将不够真实的图像驳回。

图源: Reed et. al
2017
一年后,罗格斯大学、里海大学和中国香港大学的研究人员采取了另一种 GAN 方法——“堆叠”成对的算法。第一对算法列出场景的形状和颜色,然后第二对算法细化细节。

图源: Zhang et. al
2019
2019年,另一支主要隶属于微软的团队尝试了不同的“两步走”方法。第一步是生成场景中对象所在位置的示意图,第二步是使用该示意图作为向导生成构成目标图片所需的对象。

图源: Li et. al
2020
去年年底,美国人工智能艾伦研究所发表了一项使用转换器模型的研究,与OpenAI使用的转换器模型相同。艾伦研究所的研究人员没有追求模型的规模,而是依赖于“隐蔽”。
在《麻省理工学院科技评论》上有一篇文章详细解释了这一概念,Karen Hao将“隐蔽”描述为“把不同的单词隐藏在句子中,让模型填补空白”。算法掌握这些直观性跳跃后,研究者发现生成的图像质量得到显著提升。

图源: Cho et al.
回溯过去这些研究案例,我们可以发现OpenAI的DALL-E确实是一项飞跃。从模糊不清的斑点开始,最先进的技术已发展到能够生成牛油果形状的椅子,OneZero专栏作家欧文·威廉姆斯表示他真的愿意购买这样的椅子。
这些进步足以让一代家具设计师、图库艺术家以及其他网络艺术家感到害怕。
相关文章
- 深化 “人工智能 +” 价值落地,用友领跑企业智能化下半场
- 塔猴科技正式加入重庆市人工智能学会,共筑AI内容商业新生态!
- 上海智位机器人助力青少年AI教育实践:40名中学生走进蘑菇云创客空间探索人工智能
- DNV 亮相 2026 AGIC 深圳国际通用人工智能产业博览会
- 热度不减|天宝于深圳人工智能展会现场高光不断,共探AI电源新机遇
- 人气爆棚!华秋亮相深圳国际人工智能展,用 “全链引擎“ 引爆 AI 硬件创新热潮
- 省级推荐!云工场科技入选2026年度江苏省人工智能重点服务商推荐目录
- 东软赋能「常州居民健康数据空间:重塑健康管理新模式」斩获 2026 IDC 中国人工智能创新奖
- 聚力AI创新,赋能千行百业!AI Show 2026杭州人工智能与机器人展将于9月9日启幕
- 华南理工大学校友会到访十方融海围绕人工智能产品探索与场景延展展开交流
- 高校英语教师人工智能应用能力现状及提升策略
- 数智龙江 智启新程|黑龙江省“人工智能+”赋能行业高质量发展峰会成功举办
- 北京知达客信息技术有限公司入选丰台区人工智能首批拟支持企业名单
- 落实“人工智能+”招标政策 北京筑龙采购文件智能审查解决方案
- 百度Apollo持续深耕人才生态,亮相第28届中国机器人及人工智能大赛智能驾驶专项赛
- 聚焦技术突破与产业落地 人工智能与机器人两展四大奖项启动申报
AI企业
更多>>AI硬件
更多>>- 华硕 ProArt 创梦 27 OLED:以 4K QD-OLED 与专业色彩表现,支持精细化创作
- 芯展速 Gen 6 Retimer 正式上市,副总裁李蓁 ODCC大会演讲官宣 获媒体热议
- 行业首款60℃热雾巨无霸滚筒扫拖旗舰!iRobot Roomba 875发布,重新定义扫地机器人清洁力
- 华硕主板助国产颗粒内存达成四槽满插6000C30与双条8000C36双重突破
- 首日销量突破600台!8888元的元点机器人Bridge正在赢得开发者
- 三星半导体亮相2026首届算博会,以创新存储方案赋能智能体AI
- 开学季提升成绩 入手三星Galaxy Tab S10 FE|Tab S10 FE+正合适
- 骁龙本阵营再添新成员,华硕灵耀 14 骁龙版打造新锐 AI PC 轻薄本首选
AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









