国家数据局新政落地!专利高质量数据集是AI for Science核心燃料
2026/06/10 09:13AI云资讯19598
6月8日,国家数据局正式印发《关于推进行业高质量数据集建设行动的实施方案》(下称《实施方案》),这是国家层面首次针对数据赋能人工智能发展作出系统性、全链条部署,也标志着我国人工智能产业发展正式告别单纯比拼算力、模型的阶段,全面迈入以高质量数据为核心竞争力的全新发展周期。
作为支撑“人工智能+”落地生根的核心基石,行业高质量数据集的规范化、规模化发展,将为千行百业数智化转型注入源源不断的底层动能。
政策全面布局,筑牢高质量数据集发展根基
《关于推进行业高质量数据集建设行动的实施方案》明确,行业高质量数据集是经过采集、加工等数据处理,可直接用于开发和训练人工智能模型,能有效提升模型性能的行业数据的集合,包含行业通识和行业专识数据集。行业高质量数据集是推动“人工智能+”赋能千行百业、实现产业落地的基础性、关键性资源。为落实国民经济和社会发展“十五五”规划《纲要》,深入实施“人工智能+”行动,推动行业高质量数据集建设推广与“人工智能+”同频共振、互促共进,强化数据赋能人工智能创新发展,特制定本方案。
方案设定清晰发展目标,到2028年底,建成一批覆盖重点领域、经过应用验证的行业高质量数据集,打造一批数据驱动人工智能创新发展的典型应用场景,培育一批具备领先优势的创新型数据企业和专业人才,形成一批行业高质量数据集建设工具和标准。数据从供给到价值释放的良性循环基本形成,数据赋能人工智能创新发展的作用更加凸显,数据产业与人工智能深度融合,持续催生智能经济新增长点。
在六大专项行动中,强基扩容行动作为首要任务,从四大维度铺开建设工作。一是聚焦行业领域推进高质量数据集建设,覆盖科学研究、工业制造、医疗卫生、金融服务、城市治理等诸多重点领域,同时面向低空经济、具身智能、智能驾驶、生物制造等前沿创新领域布局数据集建设。二是夯实行业高质量数据集建设基础路径,梳理行业数据资源与需求清单,依托链主单位、高校、科研院所等多方主体协同共建,推动公共数据与行业数据融合利用。三是面向人工智能应用需求丰富行业高质量数据集建设形态,发力文本、图像、点云、时序数据等多模态数据集,同步搭建知识图谱、真机交互等适配新型智能应用的数据集,紧跟世界模型等前沿方向开展布局。四是强化与数据基础设施建设有机联动,依托国家数据基础设施,运用隐私保护计算、可信数据空间等技术,实现数据集安全存储、可信流通与集约化供给。
除此之外,方案还配套部署多项专项行动,覆盖数据标注升级、数据集质量提升、场景应用赋能、全流程规范管理、数据价值释放等关键环节,从产业提质、生态搭建、制度完善、商业落地等多维度形成完整工作体系,全方位指导行业高质量数据集规范化、规模化发展。
专利高质量数据集是AI for Science核心燃料
值得注意的是,《实施方案》明确提出要兼顾产权保护与创新发展需求,完善人工智能训练阶段数据使用规则,推动版权作品数据有序用于模型训练,同时鼓励各细分行业深耕专属高质量数据集建设。在众多垂直领域数据中,专利数据天然具备成为AI顶级训练语料的四大独特属性:
1.来源权威合规,全链路可追溯。数据源自各国专利局、官方知识产权机构等权威渠道,授权清晰、确权完整,符合数据分类分级与安全管理要求,从采集到应用全流程合规可控,规避版权与法律风险。
2.知识密度高,加工标准化。经过专业清洗、去重、标引、结构化处理,剔除冗余信息,保留技术方案、权利要求、法律状态等核心知识;建立统一数据标准与专业词典,保障数据一致性与规范性。
3.多语种全覆盖,跨域可对齐。覆盖中、英、日、韩、法、德、俄等主流语种,具备跨语言平行对齐能力,支持单语种检索全球知识产权信息,适配全球化研发与创新场景。
4.专家级标注,场景适配性强。由知识产权与技术专家参与标注,覆盖技术领域划分、法律条款关联、创新价值判定等维度,数据可直接用于模型微调与任务推理,大幅降低训练成本。

用专利等知识产权数据构建的高质量数据集,能为垂直大模型技术创新带来三大核心价值:
1.专业能力的跃升。模型可以准确理解技术方案、判断新颖性与创造性、识别侵权风险、辅助专利撰写与审查。这些能力是通用模型无法具备的。
2.安全与合规的保障。由于数据来源明确、授权清晰,企业可以放心地将模型部署在高合规要求的业务中,如专利审查、技术转化、出口管制合规等。
3.研发与创新效率的提升。专利高质量数据集支撑的AI模型,能帮助科研人员、企业IP部门、技术转移机构快速检索全球技术信息、分析技术趋势、识别空白领域,缩短研发周期,加速创新成果转化。

专利高质量数据集的打造,是覆盖采集、清洗、标注、确权、应用的全链条系统工程,也是行业落地的关键。
全域采集:搭建全球专利数据采集网络,同步多国专利数据和信息,保障数据广度与实时性,形成规模化基础资源池。
专业加工:建立多语种平行语料库,通过同族专利处理、跨语言对齐等技术,实现数据标准化与互通性;依托专家标注体系,形成适配不同场景的细分数据集。
合规确权:与国家级平台协同,明确数据来源与使用权限,建立严格安全管控机制,保障数据应用安全可控。
场景赋能:数据集可直接支撑研发创新、专利审查、技术转化、侵权分析等场景,帮助创新主体提升效率、规避风险、加速成果转化。

作为深耕知识产权数据领域的科技企业,八月瓜科技依托国家知识产权局全量专利数据库及覆盖全球178个国家和地区的2亿+专利数据,打造“擎策”系列产品,汇集专利、商标、文献、工商等26亿+数据。目前,八月瓜科技已搭建起数百个高质量数据集,全面覆盖新材料、生物医药、化学化工等多个重点产业领域,针对不同细分赛道配置专属专业团队,完成数据清洗、结构化标引、专业内容标注等全流程深度加工,保障每一个数据集的专业性与实用性。
在实际应用中,依托八月瓜科技擎策平台训练的AI模型,不仅能够精准完成专利审查、技术趋势分析、创新空白挖掘等工作,还能有效缩短企业研发周期、降低知识产权运营风险。公司将以专利高质量数据集助力科研创新,全面赋能AI for Science实践落地。(AI云资讯 易云 报道)
相关文章
- Agent成为数据“新消费者”,华为云重构面向Agent的数据基础设施
- 从“被动存储“到“主动服务“ 数据基础设施迎来“场景计算“新变量
- 数博会2026|以词元破局,东软打通数据要素价值化落地新范式
- 中国移动副总经理张冬:可信AI筑基,数据智能赋能——共建国际合作新生态
- 算力如水随取随用 中国移动携手湖北大数据集团筑牢算网底座,赋能中部算力枢纽建设
- 英伟达上季度营收破960亿,数据中心成绝对主力
- 数据不搬家,语义更明确:阿里云 Polar Lakebase 支撑千万Agent规模化运行
- 四维图新:数据合规业务同比增长56%
- 谁的数据,先成为AI的“原住民”?——从2026科学智能大会,看科技数据的下一个十年
- 从“山城链”到文旅数据集:趣链科技的重庆数据要素路径
- 2026时序数据技术创新大会:多模态时序数智化软件栈发布,生态计划启动
- 一句话查询商业信息,启信宝AI问企降低数据应用门槛
- 热浪之下,稳守机房“生命线”|科士达精密空调筑牢数据中心温控屏障
- 腾讯云发布 AI 数据底座 TDSQL Nexa,多项 AI 数据库能力进入生产环境
- 漏检率降超80%背后:趣链科技的可信数据空间落地路径
- 四维图新CEO程鹏:高质量数据是具身智能规模化发展的基石
AI企业
更多>>AI硬件
更多>>- 华硕 ProArt 创梦 27 OLED:以 4K QD-OLED 与专业色彩表现,支持精细化创作
- 芯展速 Gen 6 Retimer 正式上市,副总裁李蓁 ODCC大会演讲官宣 获媒体热议
- 行业首款60℃热雾巨无霸滚筒扫拖旗舰!iRobot Roomba 875发布,重新定义扫地机器人清洁力
- 华硕主板助国产颗粒内存达成四槽满插6000C30与双条8000C36双重突破
- 首日销量突破600台!8888元的元点机器人Bridge正在赢得开发者
- 三星半导体亮相2026首届算博会,以创新存储方案赋能智能体AI
- 开学季提升成绩 入手三星Galaxy Tab S10 FE|Tab S10 FE+正合适
- 骁龙本阵营再添新成员,华硕灵耀 14 骁龙版打造新锐 AI PC 轻薄本首选
AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









