英伟达推出可创作音乐、修改语音的AI模型Fugatto
2024/11/26 10:17AI云资讯185214

(AI云资讯消息)英伟达推出了一款新的生成式音频AI模型,它可以根据用户简单的文本和音频提示生成各种声音、音乐甚至语音。
这个模型被命名为Fugatto,又名基础生成式音频变换器Opus 1。根据11月25日的公告信息,它可以仅根据文本提示生成铃声和歌曲片段,对现有曲目添加或删除乐器和人声,修改声音的口音和情感,甚至让人们创造出前所未有的声音。
英伟达应用音频研究部门的经理拉斐尔·瓦莱(Rafael Valle)表示,“我们希望创建一个能够像人类一样理解和生成声音的模型,Fugatto是我们朝着未来迈出的第一步,在那个未来,音频合成和转换的无监督多任务学习将从数据和模型规模中涌现出来。”
英伟达指出,音乐制作人可以使用AI模型快速原型化和审核各种音乐风格和不同编排的歌谱,或者为现有曲目添加效果和额外的音轨。Fugatto模型还可以用于适应和本地化现有广告活动的音乐和旁白,或者在游戏玩家通过关卡时实时调整游戏音乐。
Fugatto模型甚至能够产生以前闻所未闻的声音,如咆哮的小号或喵喵的萨克斯。在此过程中,它使用了一种称为ComposableART的技术来组合它在训练期间学到的指令。
英伟达AI研究员罗汉·巴达兰尼(Rohan Badlani)表示,“我想让用户以主观或艺术的方式组合属性,选择他们对每个属性的强调程度。在我的测试中,结果常常令人惊喜,让我感觉自己仿佛是一位艺术家,尽管我是一名计算机科学家。”
Fugatto模型本身使用了25亿个参数,并在32个H100 GPU上进行训练。像这样的音频AI技术正变得越来越常见。4月份,Stability AI推出了一个类似的系统,可以生成长达三分钟的曲目,而谷歌的V2A模型则可以为任何视频输入生成无限数量的音轨。
YouTube最近推出了一款AI音乐混音器,它根据输入歌曲和用户的文本提示生成一段30秒的样本。甚至连OpenAI也在这一领域进行实验,今年4月推出了一款AI工具,只需15秒的样本音频即可完全克隆用户的声音和发声模式。
相关文章
- 英伟达斥资129.3亿美元收购Hugging Face,巩固AI硬件领域的主导地位
- 英伟达百亿押注OpenAI算力基地,潜在回报或达两千亿美元
- 英伟达上季度营收破960亿,数据中心成绝对主力
- SpaceX AI加码英伟达Vera平台,借力Vera CPU与Vera Rubin服务器加速自主AI
- 告别交流电!英伟达800伏直流电方案攻克供电瓶颈,算力迎爆发式增长
- 英伟达Kyber机架配备340.4TB内存,HBM4E单价19.76美元/GB,单机架售价高达4160万美元
- 英伟达与微软牵头成立开放AI安全联盟,OpenAI、谷歌及Anthropic均未加入
- 英伟达缩减Vera Rubin芯片内存配置,因HBM4成本高涨将占单机架总成本29%
- 英伟达图形研究亮相SIGGRAPH 2026:21项突破性技术加速仿真与物理AI
- SpaceX向富士康下了520亿美元的巨额订单,采购搭载英伟达GB300芯片的AI服务器机架
- 英伟达Rubin全液冷时代,川润股份“算力液冷+绿色能源”全链条闭环服务卡位千亿赛道
- AMD EPYC Venice处理器到2027年将以675万颗的出货量超越英伟达Vera CPU
- 英伟达称其AI数据中心采用高温运行设计,可大幅减少用水量
- 英伟达抢建物理AI算力工厂,微美全息(WIMI.US)锚定芯片赛道掀起GPU热潮!
- 云工场科技加快多元智算布局,构建 AMD、沐曦、英伟达协同算力体系
- 数据中心耗电远超电网负荷,迫使英伟达与谷歌在2026年第三季度前启动800V直流电架构改造
AI企业
更多>>AI硬件
更多>>- 华硕 ProArt 创梦 27 OLED:以 4K QD-OLED 与专业色彩表现,支持精细化创作
- 芯展速 Gen 6 Retimer 正式上市,副总裁李蓁 ODCC大会演讲官宣 获媒体热议
- 行业首款60℃热雾巨无霸滚筒扫拖旗舰!iRobot Roomba 875发布,重新定义扫地机器人清洁力
- 华硕主板助国产颗粒内存达成四槽满插6000C30与双条8000C36双重突破
- 首日销量突破600台!8888元的元点机器人Bridge正在赢得开发者
- 三星半导体亮相2026首届算博会,以创新存储方案赋能智能体AI
- 开学季提升成绩 入手三星Galaxy Tab S10 FE|Tab S10 FE+正合适
- 骁龙本阵营再添新成员,华硕灵耀 14 骁龙版打造新锐 AI PC 轻薄本首选
AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









