迷失于(附带性)记忆:当判例法将人工智能训练误认为复制

时间:2025-12-29

来源:The IPKat

作者:Söğüt Atilla - Aydın

类型:版权


涉及国家/地区:德国

发布时间:2025-12-29

技术领域:{{fyxType}}

在德国音乐版权管理协会(GEMA)诉OpenAI一案中,慕尼黑近期作出的判决(42 O 14139/24,有德语版本)体现了在人工智能训练方面,法律与技术之间存在交流不畅的问题。法院将模型训练过程中固有的附带性记忆和临时副本视为侵犯作品复制权的行为。这种解释不仅将“复制”的含义过度延伸,远超其本意范围,还损害了欧盟文本与数据挖掘(TDM)例外的目的。


法院承认,依据欧盟委员会的政策,文本与数据挖掘例外可合法用于创建人工智能训练语料库。但法院也认为,即便模型内部不存在任何物理副本,仅凭从模型参数中重建作品的可能性就足以构成对复制权的侵犯。据此,法院裁定,如果模型能够逐字复制受保护的歌词,那么该模型本身就可能构成这些歌词的“副本”。因此,法院实际上将潜在的统计表征等同于固定副本。这引发了重大的解释和实践问题。


模型能否仅基于统计关联就成为“副本”?

大型语言模型(LLMs)存储的是统计关系,而非用于训练它们的数据的逐字复制内容。将内部表征视为侵犯复制权的行为,可能会模糊辅助材料与版权作品之间的关键区别。这种解释产生的效果,与欧盟将计算机程序在有争议的“预备设计材料”标签下进行保护的做法类似。

相比之下,英格兰和威尔士高等法院近期在盖蒂图片社(Getty Images)诉稳定人工智能公司(Stability AI)一案中的裁决认定,稳定扩散模型(Stable Diffusion)并未“存储或复制”盖蒂图片社的图像(第600段,详见《知识产权猫》相关报道)。研究发现,稳定扩散模型各版本的模型权重从未包含或存储过侵权副本。由此可见,法院似乎将表征的技术性质视为决定性因素。然而,关键的法律问题仍然存在:在法律允许的关联/表征与可依法追究责任的复制行为之间,界限应划在哪里?


在我看来,只有当通过该媒介的正常使用能够感知到副本时,副本才存在。虽然这并不能完全解决记忆问题,但有助于防止复制的概念变得过于宽泛。否则,我们将再次陷入争论链接是否构成作品副本(以及为何不应构成)的困境。


证据衡量标准是否充分?

慕尼黑的判决似乎依据小片段(例如,一段25个单词的副歌或几行文字)来推断模型构成副本。的确,机器学习模型可能会逐字记忆训练数据,尤其是在模型规模较大或训练数据存在重复的情况下。然而,关于大型语言模型记忆现象的实证研究表明,该现象并非源于受保护作品与单个参数之间简单的一对一映射。相反,记忆是模型一般语言能力相关的多种因素之间分布式表征和相互作用的结果(参见黄等人,2024年)。

具有复制的可能性并不自动意味着模型以相关意义存储了作品。莫里斯等人(2025年)估计,大型语言模型每个参数仅存储约3.6比特的信息。对于一个拥有十亿参数的模型而言,这大致对应于约450兆字节的记忆信息,远少于用于训练的数百吉字节(甚至太字节)数据。这表明,模型无法逐字存储整个版权作品;对片段的任何复制都是概率性的且分散的。


因此,法院应要求提供系统且具有统计可靠性的证据。这可能包括提取的可重复性、长序列检索、曝光/对数概率指标以及对实际经济损失的评估。最终,经济影响可能是最重要的因素,因为市场稀释等论点尚未在法庭上得到证实(参见卡德里诉Meta案)。但如果歌词等作品已在网上广泛传播,那么在输出生成过程中对其附带性复制是否构成侵权?如果是,损害程度又如何?


附带性包含及可能的上诉主要论点

一种例外情况并不排除使用另一种例外情况。《信息社会指令》第5条第3款第(i)项允许在“其他材料”中附带性地包含作品。然而,慕尼黑法院驳回了这一论点,称法律要求较大的材料必须是一部作品。尽管如此,该指令本身提及的是“其他材料”,而非“其他作品”。不同语言版本(法语:“dans un autre produit”;德语:“in anderes Material”)证实,其范围比慕尼黑判决所认定的更为宽泛。

如果模型的记忆是无意的且罕见,并且模型的主要功能并非复制受保护的作品,那么这可能符合附带性包含的条件。这可能是OpenAI上诉的关键论点。训练此类模型需要让它们接触大量示例(例如图像或文本),以便它们学习数据中有助于执行特定任务的统计关联。在训练过程中,模型进行预测,测量产生的误差,并通常使用反向传播调整其内部参数,以逐步提高性能。通过这种方式,模型学习从训练数据中得出的抽象统计模式,并能够对新案例进行预测(参见勒昆等人)。


鉴于模型的预期目的,其统计表征中包含的任何副本很可能都是附带性的。目标是概括信息,而非记忆训练数据集中的特定示例。对于后者,有更好的方法。


总结

反对将文本与数据挖掘例外用于人工智能开发是适得其反的,尤其是考虑到文本与数据挖掘与附带性包含相结合,可作为针对大多数潜在侵权行为的抗辩理由。


从合法可访问的来源收集数据以创建训练语料库,以及在开发用于估计实例或类别标签概率的算法过程中复制这些数据,均属于该指令对文本与数据挖掘的定义范畴。模型后续使用过程中出现的无意识错误,如记忆、过拟合以及输出中的其他“复述”情况,可视为附带性包含。


有些人可能仍会认为,三步检验法阻碍了文本与数据挖掘例外在此类活动中的应用(详见《知识产权猫》相关报道)。但这需要逐案评估,而非得出一般性结论。首先,必须证明此类使用不合理地(而不仅仅是)损害了作者合法的(而非任何)利益,这需要经济分析,而非法律意见。


来源:https://ipkitten.blogspot.com/2025/11/guest-post-lost-in-incidental.html

本文原文为英文,中文为机器翻译,仅供参考,如有问题或建议,欢迎随时与我们联系。

x
{{message}} 忘记密码? 免费注册
{{message}} 已有账号? 返回登录

注册完成