从石油到宝石:我们对数据价值的认知转变

时间:2025-10-30

来源:The IPKat

作者:Dr Rose Hughes

类型:商标;专利;版权;域名


涉及国家/地区:英国

发布时间:2025-10-30

技术领域:{{fyxType}}

今年,英国专利律师协会(CIPA)大会聚焦人工智能相关议题。我与本·霍伊尔(Hoyle IP服务有限公司)、科琳娜·布林克(Two IP)以及胡里奥·丰塞卡(ASML)有幸在大会上参与一个以“数据是新石油”为主题的专题讨论,该讨论由格雷格·科科兰(Greg Corcoran IP)主持。需要说明的是,以下观点仅代表本“猫”个人,不代表其他小组成员的观点。


“数据即石油”这一概念已流传多年,但这个类比如今是否还适用呢?从制药与生物技术行业的视角来看,本“猫”发现,如今人们不再将数据视为一种大宗原材料商品,而是开始追求能够提升人工智能模型性能的高质量数据。这一转变对知识产权战略以及与数据相关的许可条款有着重要影响。


数据曾是新石油

“数据”是一个极为宽泛的概念。从最基础层面来讲,数据可定义为事实、数字和统计数据的集合。谷歌图书Ngram查看器显示,“数据”一词在20世纪90年代才真正开始受到关注,随后在千禧年初的使用量急剧上升。数据一词使用量的增加,与自90年代起社会可获取信息的大幅增长密切相关,这一增长部分得益于互联网的普及,部分得益于计算技术和科学发现(如基因测序技术)的进步。


“数据是新的石油”这一概念,是《经济学人》2017年的一篇头条报道使其进入大众视野的,该报道宣称“世界上最有价值的资源不再是石油,而是数据”。有趣的是,自那以后,关于数据及其在经济中应用的讨论,往往聚焦于这一表述的负面含义,尤其是大型科技公司对个人信息的利用。然而,对于知识产权行业所服务的科学技术领域而言,“数据即石油”这一类比有着不同的内涵。信息规模和复杂程度的爆炸式增长催生了大数据领域(大约在2007年成为热门词汇)以及专门分析和处理这些数据的相关学科(还记得系统生物学吗?)。


重要的是,这些大数据为随后出现的人工智能系统提供了必要的基础。现代机器学习领域从根本上依赖于海量数据来学习、改进并做出准确预测。没有公共蛋白质序列数据库,就不会有获得诺贝尔奖的AlphaFold;没有互联网上大量的语言数据,就不会有大型语言模型(LLMs)。这些庞大的信息库对于训练现代人工智能的底层模型至关重要。

1.png

从石油到宝石

数据的不同类型

作为训练数据推动人工智能领域发展的数据有多种形式,涵盖众多格式和科学领域,具体取决于人工智能的类型。对于早期的视觉人工智能模型,如卷积神经网络(CNNs),主要数据由图像构成。例如,可用于检测癌症的乳房扫描和磁共振成像(MRI)扫描等医学影像,以及用于灾害管理等应用、通过航空监视收集的视觉、红外和雷达图像。重要的是,用于科学发现的人工智能模型的生成依赖于庞大的数据集,如基因测序产生的基因组和蛋白质组信息、包含蛋白质结构的蛋白质数据库中的数据,以及半导体芯片设计的模拟结果。对于像大型语言模型这样的生成式人工智能,训练数据主要是文本和代码,通常是从公共互联网上抓取的。


除了初始训练数据外,机器学习中另一类关键数据围绕人工智能模型本身的性能和优化。这包括模型优化数据,如在强化学习与人类反馈(RLHF)等技术中收集的人类反馈。在这一过程中,人类评审员对人工智能生成的回复进行排名或识别错误,然后将这些反馈作为数据来更新和微调模型。模型的输出也构成了一种关键数据类型,其范围从专利检索工具生成的按优先级排序的文件列表,到AlphaFold预测的蛋白质三维结构。最后,关于模型有效性的统计数据是用于评估性能的关键数据形式。例如,将机器学习系统与人类医生准确性进行比较的研究,就提供了关于模型实用性的定量数据。


寻找数据宝石

我们都能认同,大数据是驱动人工智能引擎的燃料。正如引擎没有燃料就无法运转,人工智能模型没有海量信息用于训练也毫无用处。然而,当我们考虑数据质量时,这个类比就开始站不住脚了。与相对单一的原油不同,可用数据的类型和质量存在巨大且往往未被充分认识的差异。


然而,“数据即石油”这一类比持续流行,导致了一种持续的误解,即认为所有数据都有价值。的确,在大数据早期,重点主要放在数据量上。然而,如今我们拥有的数据量如此庞大,以至于很多数据不仅毫无价值,还可能因引入和加剧无关噪声和偏差而对人工智能模型造成损害。以用于训练大型语言模型的专利数据为例。谷歌专利包含大量撰写糟糕的专利申请(以及已授权专利)。因此,用更多此类数据训练大型语言模型,不太可能提高其撰写专利申请的能力。


因此,人工智能软件开发者正将精力重新聚焦于挖掘高质量数据。更干净、更相关的数据集变得愈发有价值,人们也愈发关注如何获取这些数据。换句话说,我们现在正在寻找数据宝石。宝石稀有、形态精准且价值连城。对于预测肿瘤的人工智能模型而言,数据宝石可能表现为一个精心整理的医学数据集,其中数千张磁共振成像扫描由多位专家放射科医生仔细标注以识别肿瘤。对于开发自动驾驶汽车的公司来说,有价值的数据不再是又一百万英里平淡无奇的高速公路行驶记录。相反,是罕见的事故险情视频片段、大雨中复杂的十字路口场景,或是孩子跑上马路的画面。这些高质量、往往罕见的数据点,是提高人工智能模型性能的关键,使其能够更专业、更准确地执行任务。


从数据用于模型优化和性能的角度来看,这种从数据即石油到寻找数据宝石的关注点转变同样适用。人们同样将关注点转向识别那些能够提高模型输出质量的罕见、高价值性能数据。以大型语言模型为例,在高度技术领域出现的幻觉问题,不太可能通过采用与模型训练数据相似的更多通用数据这种简单粗暴的方法来识别和解决。相反,现在的重点是通过强化学习与人类反馈(RLHF)(IPKat相关报道)进行专家标注和优化,以及开发能够识别模型生成错误和幻觉的方法。


对知识产权战略的影响

从数据作为大宗商品到精心整理的数据宝石,这一关注点的转变对知识产权战略有着重要影响。目前,数据的价值不在于原始信息本身,而在于为整理、标注和构建数据所付出的智力努力、投资和专业知识。这也是可受保护的知识产权所在之处。


与数据最相关的知识产权包括数据库权、版权和商业秘密。在英国和欧盟,特殊数据库权保护在获取、核实或呈现数据库内容方面所做的重大投资(IPKat相关报道)。数据库权可以保护为创造有价值数据所进行的投资,例如,通过资助大规模临床试验并运用生物信息学技术分析结果,或聘请专家标注数千张图像。


此外,在许多情况下,最有效的保护方式是将这些高价值数据集视为商业秘密。经过整理的数据集因其不为公众所知而价值,并且可以采取合理措施对其保密。这并非全新概念。例如,制药行业长期以来一直将其高质量的临床试验数据、化合物库和专有检测结果视为严格保护的“王牌资产”。


然而,企业必须抓住的一个关键点是,为人工智能模型训练识别、清理、标注和构建数据这一行为本身,就是一项具有重大增值的活动。许多非科技公司,包括制药公司,可能拥有庞大的原始数据存储库,但缺乏内部专业知识来提炼数据,使其可用于训练人工智能模型。这种脱节可能带来重大风险,即公司在与科技合作伙伴合作时可能低估自身资产价值,或者反过来,为何与人工智能公司尽早建立合作关系对于从数据中提取真正价值至关重要。


对许可的影响

从知识产权许可的角度来看,在许可和合作协议中区分原始低质量数据和经过处理、标注的数据至关重要。那种以名义费用授予对数据集广泛权利的标准数据许可协议已不再适用。协议现在必须更加精细,使用精确的定义来明确区分许可的整理数据与任何原始输入数据。此外,合同条款必须涉及数据的输出和应用。这包括主张对从许可数据衍生出的任何改进、模型或见解的所有权,或至少拥有访问权。同时,严格的用途限制至关重要,以限制被许可方将数据用于特定目的,防止其利用该资产训练可能与许可方核心业务竞争的其他模型。最后,必须重新校准许可的估值。许可费、特许权使用费或股权份额应反映整理数据作为关键促成资产的真实价值,而非仅仅将其视为一种商品的销售成本。


最终思考

正如我们将在大会专题讨论中所探讨的, “数据是新的石油”这一表述对于我们理解当今现代人工智能模型的开发方式仍具有重要意义。然而,在供给主导的经济中,我们如今拥有的数据量庞大,且其中大部分质量低下,这降低了通用新数据作为可大规模开采的大宗商品的价值。知识产权战略需要认识到这一转变,并将重点转向保护真正具有价值的数据,即那些代表新数据宝石的红宝石、祖母绿和蓝宝石。


来源:https://ipkitten.blogspot.com/2025/10/from-oil-to-gemstones-our-shifting.html

本文原文为英文,中文为机器翻译,仅供参考,如有问题或建议,欢迎随时与我们联系。

x
{{message}} 忘记密码? 免费注册
{{message}} 已有账号? 返回登录

注册完成