时间:2025-12-31
发布时间:2025-12-31
影子图书馆是庞大的在线资源库,其中包含数以百万计的盗版书籍和文章,可在网站上免费下载。[1]在“官方渠道”之外分享受版权保护的作品,已被认定为一种长期存在的行为。博多(Bodó)等学者指出,像创世纪图书馆(Library Genesis,简称“LibGen”)和科学图书馆(Sci-Hub)等主要影子图书馆的历史根源可追溯至苏联时期,当时人们通过未经授权的影印来抵制审查,以及20世纪90年代俄罗斯学者在经济危机期间传播文献的尝试。[2]然而,将未经授权的作品副本整合成数字收藏库的现象,是在21世纪初随着技术发展使得此类活动能够“大规模自动化”而出现的。[3]在第一个数字图书馆——古登堡计划(Project Gutenberg,该计划在互联网的前身上提供公有领域作品)之后的几十年里,个人收藏的数字化作品逐渐发展成规模更大的项目,且越来越容易受到版权侵权指控。[4]尽管一些收藏迁移到了离线的“暗库”,但其他一些则发展成了更具“策展性”的公共档案库,秉持着抵制“出版寡头”和学术付费墙的理念,并具备了图书馆的许多特征,如目录。[5]在现代形式中,像科学图书馆(Sci Hub)这样的影子图书馆还利用与西方大学相关的私人账号来访问关键数据库,以满足用户的搜索需求,其运作方式是当用户下载作品时,该作品的副本会被保存到创世纪图书馆。[6]2023年之前,涉及创世纪图书馆和科学图书馆等影子图书馆的法律行动主要集中在针对影子图书馆本身的删除通知和禁令上。[7]然而,2023年7月7日,作家莎拉·西尔弗曼(Sarah Silverman)与其他多位作家共同对Meta和OpenAI提起诉讼,声称这些公司使用了从影子图书馆中提取的受版权保护的文本,来训练人工智能(AI)模型。[8]
通过生成式人工智能(GAI)的开发方式,可以更好地理解影子图书馆在生成式人工智能行业中的新兴角色。生成式人工智能是一种人工智能形式,[9]它能够根据特定提示生成文本、声音或图像。[10]为了创建生成式人工智能系统,开发者需要大量材料或“人工智能数据集”,这些数据集由作为“输入数据”的文本和图像组成。[11]随后,开发者对数据集进行文本和数据挖掘(TDM),这是一种计算机过程,用于分析和提取整理数据中的信息和模式。[12]提取的信息随后被生成式人工智能模型吸收,以训练其生成类似内容或“输出”。[13]然而,生成式人工智能开发者面临的一个挑战是,输出的质量在很大程度上取决于所使用的训练数据的数量和质量。[14]因此,人工智能训练通常涉及从在线资源库和互联网数据库中复制大量可靠、高质量的作品。[15]
在此背景下,人们开始关注生成式人工智能开发者在抓取在线作品时,是否通过从影子图书馆获取作品而侵犯了版权所有者的专有权。[16]鉴于Meta承认使用了Books3数据集(该数据集常用于训练文本生成式人工智能模型,且主要由来自影子图书馆Bibliotik的盗版书籍组成),这一问题尤为令人担忧。[17]尽管《欧盟数字单一市场版权指令》(CDSM)[18]为文本和数据挖掘创建了版权例外,但许多司法管辖区的版权框架目前对数据集的法律地位和版权保护保持沉默。在此背景下,本文的核心目标是确定如何制定有效的数据集版权法,以促进生成式人工智能创新,同时保护作者免受影子图书馆材料的非法使用。
澳大利亚作为这样一个没有针对人工智能或文本和数据挖掘制定特定版权法的司法管辖区,鉴于其政治和利益相关者对人工智能训练材料日益增长的兴趣,被选为案例研究对象。2023年12月5日,总检察长宣布成立版权与人工智能咨询小组,该小组作为一个“常设机制”,就包括人工智能训练数据合法性在内的各种问题,与技术、创意和媒体部门的利益相关者进行接触。[19]自那时以来,澳大利亚作家和创作者对未经许可使用其作品的行为表达了越来越多的不满,澳大利亚作家协会最近发表声明称,对于澳大利亚书籍被纳入“盗版书籍”数据集感到“震惊”,而创意澳大利亚(Creative Australia)则表示担忧,认为包括人工智能开发在内的科技行业的“全球性”使得在未经同意的情况下使用作品时,知识产权执法变得更加困难。[20]因此,关于人工智能导向改革的政治讨论取得了进展,2025年8月,生产力委员会提出了扩大公平交易例外以涵盖人工智能开发者进行的文本和数据挖掘的可能性,而采纳人工智能特别委员会则建议实施专门的人工智能立法,其中除其他事项外,要求在开发人工智能时公开所使用作品的信息。[21]鉴于该领域政治和利益相关者讨论的当前进展,澳大利亚非常适合作为人工智能导向版权改革的案例研究对象,希望本文的理论和法律分析能够为其他同样在审视当前版权框架充分性并设计改革以更好地监管盗版数据集材料的司法管辖区提供参考。具体而言,由于影子图书馆在人工智能背景下尚未成为广泛学术分析的对象,本文旨在研究拟议的改革如何能够在促进人工智能创新的数据集中使用受版权保护的作品,同时避免无意中使影子图书馆合法化。
为了解决这一核心问题,本文将首先制定评估性理论标准,用于确定人工智能时代“有效”版权法的构成。本文将提出一个“IAP测试”(作者激励、作品获取和公共利益),该测试既可用于评估现行法律的有效性,也可用于设计更符合人工智能时代商业、社会和文化现实的未来法律。随后,本文将分析澳大利亚1968年《版权法》(联邦)(“版权法”)中的复制权及相关例外,包括临时复制和公平交易,以确定数据集的当前合法性,并评估该法律在平衡创新与作者和公众限制影子图书馆使用方面的有效性。基于这一理论和法律基础,本文将随后研究欧盟的《数字单一市场版权指令》和《人工智能法案》(“AI法案”)[22]如何共同规范影子图书馆在数据集创建中的使用。基于这些见解,本文将建议澳大利亚实施一种经修改的类似《数字单一市场版权指令》风格的文本和数据挖掘版权例外,并对“合法获取”要求给出更清晰的定义,以确保影子图书馆不会被无意中合法化。最后,本文将建议这些改革应伴随有强制性的数据集来源披露义务,类似于《人工智能法案》中的规定,以便对非法数据集的创建和使用进行监管和起诉。
本文共分为五个部分。第二部分提出了一个多元化框架,即本文所称的“IAP测试”,用于评估人工智能时代版权法的有效性,该框架整合了功利主义和赫尔德的有效判断测试的方面。[23]第三部分考虑了澳大利亚版权法下数据集的法律地位以及不断发展的学术讨论,指出了各种不确定性和分歧领域。在此基础上,第四部分将第二部分开发的IAP测试应用于第三部分的发现,以评估澳大利亚版权法在数据集创建和影子图书馆使用方面的当前有效性。为了为法律改革提供潜在见解,第五部分研究了欧盟文本和数据挖掘例外下数据集的法律地位,以及《人工智能法案》下的披露义务是否会揭露开发者对影子图书馆材料的使用。最后,第六部分提出了一系列改革建议,以制定更有效的数据集版权法,更好地平衡促进人工智能创新与保护作者免受影子图书馆使用的影响。
来源:https://academic.oup.com/jiplp/advance-article/doi/10.1093/jiplp/jpaf072/8341529
本文原文为英文,中文为机器翻译,仅供参考,如有问题或建议,欢迎随时与我们联系。