韦乐平:随着模型规模的日益扩大,跨域训练是必然趋势
2025/04/23 15:56AI云资讯10841
4月23日消息,在今天举办的“2025云网智联大会”上,SNAI推委会荣誉主席、原中国电信科技委主任韦乐平分享了对智算拉远的思考。
谈及大模型训练智算拉远的市场需求,韦乐平坦言,可以以网补算,提升闲散智算中心算力资源利用率。“面对大批分散部署、利用率很低的小规模智算中心,若能通过网络互联形成一个大型的逻辑智算池来适应规模日益增长的大模型训练,有望大幅提升闲散智算资源的利用率。”
与此同时,他指出,迈向未来,跨域训练是必然趋势。按照统计,大模型参数每1-2年增长10倍,而对应的GPU芯片的算力仅增长2-4倍,远低于模型规模的增速。随着模型规模的日益扩大,单体的算力、电力、空间资源终将受限,可能需要在园区甚至更大范围内由多个智算中心互联形成一个超级逻辑智算资源池,进行联合训练才有可能支撑超大模型的训练。

韦乐平强调:“至于推理与具体业务场景和访问量相关,更需要跨域实施。”
针对大模型训练智算拉远的挑战,韦乐平认为复杂的商用场景,势必会面临大量不同功能、性能的异构GPU、规模不同的AIDC的互联、不同业务场景、不同设备和不同组网方式、不同模型和不同参数的协同挑战。
此外,还面临一些技术挑战。在韦乐平看来,一是带宽收敛问题。“无收敛带宽普适性和前瞻性好,部署快,但成本太高;收敛比4-8时,带宽成本可以降至10%之内,但是只适用特定业务场景下的特定模型拆分方式,缺乏普适性和前瞻性。”
二是功能和性能问题。拉远后必然面对丢包、抖动乃至中断故障等诸多挑战,对ROCE网络的功能和性能有不少严格的要求。
统一管理和运维也是挑战之一。韦乐平认为,现有固化的组织架构和生产流程不适合快速部署逻辑统一的异地智算中心,需要对现有管理运维体系、生产流程、监控管理平台改造升级。
相关文章
- 云图知行发布空间智能推理计算大模型,空间智能全球化布局再提速
- 极摩客EVO‑X5 Pro柏林首发:可离线跑300B大模型智能体PC亮相IFA2026
- 傲融云客大模型方案落地家电售后,AI智能客服助力企业降本增效
- 星火X2.5-4B和1.7B开源,端侧AI正在改写“好模型”标准
- 谷歌推出全新 Gemini 3.8 Flash 模型:性能再升级,成本或将上涨
- 受 Hugging Face 遭黑客攻击事件影响,OpenAI 推迟新模型研发
- 连连数字Lianlian XWorker开启全球首批内测招募,推动AI从模型调用走向任务执行
- 让大模型少做重复计算 中科曙光发布ParaCache
- 慧灵科技发布60个垂直场景模型:让AI从场景感知走向落地执行
- 重磅发布|极佳视界首次提出通用世界模型 L1-L5 分级体系
- 批量生成3D内容成可能,群核科技发布3D生成模型Lux3D
- 西门子ICX给企业AI大模型构建业务“数字孪生”
- 腾讯云与卡尔动力达成战略合作,AI助力L4级自动驾驶模型迭代
- BOE(京东方)蓝鲸显示大模型亮相央视《焦点访谈》 让AI真正走进制造核心环节
- OpenAI的Bel模型参数突破10万亿,或成全球首个AGI门槛级基座
- 礼博士旗下“依明科技”PLM大模型破解服装行业信息衰减难题
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









