时间:2025-12-26
发布时间:2025-12-26
走进Perplexity AI的人工智能问答机,这是一款“由先进人工智能驱动的搜索引擎和问答引擎”。它基于多个大语言模型(如GPT - 4、Claude和Llama)进行训练,通过检索增强生成(RAG)技术,整合“实时网页搜索功能,为用户查询提供精确、来源可靠且最新的回答”。Perplexity AI是“杰夫·贝索斯家族基金、英伟达以及知名投资者巴拉吉·斯里尼瓦桑(Balaji Srinivasan)等人”投资的产品,是一款“价值180亿美元且带有引用来源的人工智能问答机”。作为一款自主智能体式人工智能应用,Perplexity AI宣称其效率极高,可用于“规划旅行、研究购物选项、管理求职、消除待办事项清单以及处理跨越无数标签页的在线琐事”。
将混合大语言模型接入互联网是否侵犯版权法?Perplexity AI坚称:“它不会像OpenAI或Anthropic那样训练大型基础模型,而是利用现有数据实时回答问题并注明来源……”然而,Reddit、道琼斯(Dow Jones)、纽约邮报控股公司(NYP Holdings)、大英百科全书(Encyclopaedia Britannica)和韦氏词典(Merriam - Webster)在美国发起的诉讼,以及日本《日经新闻》(Nikkei)和《朝日新闻》(Asahi Shimbun)(主要报纸出版商)发起的诉讼,都表明互联网的边界正在被重新划定(再次)。这种情况可能还会延伸至英国,英国广播公司(BBC)已威胁要对Perplexity AI采取法律行动。
总体而言,这些案件的核心是Perplexity AI在其RAG数据库中非法获取版权作品。然而,对于将技术行为定性为侵权使用,各方存在不同看法。Reddit指控称:“Perplexity AI的商业模式实际上是从谷歌搜索结果中获取Reddit的内容,将其输入第三方的语言大模型,然后宣称这是一个新产品。”Reddit重点关注的是,RAG需要非法绕过旨在防止网络爬虫抓取的技术保护措施(TPM)。尽管Perplexity AI估值高达200亿美元,却仍未获得相关许可。投诉详细说明,Reddit通过创建一个“测试帖子”(该帖子仅能通过谷歌搜索结果访问)发现Perplexity AI“现行违法”,该帖子在发布几小时后就出现在用户的回答中。
道琼斯除其他指控外,还认为RAG数据库包含未经授权的复制内容,且Perplexity的输出包含完整或部分复制内容。大英百科全书和韦氏词典除其他指控外,还声称Perplexity AI存在与抓取相关的版权侵权行为,以及在输入和输出阶段的非法复制行为。
所有原告都强调,Perplexity AI对其收入造成了损害,因为该应用鼓励用户“跳过链接”,导致源网站的流量减少。作为回应,Perplexity AI指出其“引用来源”功能以及带来的推荐流量是其“问答引擎区别于市场的关键”,这使其RAG系统合法化。他们辩称,回答不仅包含来源引用,而且这些引用“可点击”,能为源网站带来流量。
在所有诉讼中,Perplexity AI都被描述为恶意行为者。Reddit援引Cloudflare的评估称,“Perplexity使用隐蔽、未声明的爬虫来逃避网站禁止爬取的指令”,其行为类似于“朝鲜黑客”,而非“一家信誉良好的人工智能公司”。具有讽刺意味的是,在一个子版块讨论帖中,Perplexity AI回复称,“这是公共数据成为上市公司商业模式重要组成部分时发生的可悲案例”,并认为该诉讼“与开放互联网的理念背道而驰”。他们还指责Cloudflare的系统“根本无法区分合法的人工智能助手和实际威胁”,并指出“如果你无法区分有用的数字助手和恶意爬虫,那么你或许就不应该对什么构成合法的网络流量做出决策”。
Perplexity AI将自己描绘成“开放网络的救星”,但Reddit强调自身作为“用户社区讨论和真实人类话语的守护者”的角色,认为Perplexity AI的使用可能会带来风险。更广泛地说,本文作者认为这是一场检验版权制度边界的讨论。自主智能体式人工智能系统让她联想到Meltwater案中面临的相同挑战,当时欧盟法院(CJEU)裁定终端用户浏览无需获得许可。这巩固了内容提供者使用“围墙花园”(如付费墙、robots.txt协议和订阅服务)来控制对其内容和数据的访问,也促使欧盟引入了新闻出版者权(数字单一市场版权指令第15条)。后者将在Like Company诉谷歌案(C - 250/25)中加以探讨,该案涉及谷歌的人工智能聊天机器人Gemini训练大语言模型并生成类似输出(相关内容见IPKat)。
授权协议
在幕后,一系列日益复杂的协议正在再次改变与版权相关的互联网权力不对称格局。其中最引人注目的是Getty Images与Perplexity AI达成的多年授权协议,旨在“提升人工智能驱动的搜索可视化效果”。根据协议:
Getty通过应用程序接口(API)整合为Perplexity提供视觉内容,使该人工智能平台能够直接从其庞大的图片库中获取授权图片,让用户能够访问带有恰当署名的优质内容。
Perplexity将在生成的答案中包含图片版权信息和来源链接。此前,Getty在英国针对Stability AI提起的首次诉讼大多以失败告终(相关内容见IPKat)。Perplexity还实施了“出版商计划”,据称与《时代》周刊(TIME)、《明镜》周刊(Der Spiegel)、《财富》杂志(Fortune)等出版商共享收入。Perplexity承诺,广告收入分成将达到“两位数”百分比。他们认为这是一种避免“侵蚀出版商利益或与出版商竞争”的方式,以确保“存在这些充满活力且多样化的商业模式和收入来源”。OpenAI也采取了类似做法,与包括新闻集团(道琼斯)、英国《金融时报》和阿克塞尔·斯普林格集团(Axel Springer)在内的出版商签署了授权协议。事实上,尽管Perplexity AI提出驳回动议,道琼斯的案件仍将进入审判阶段。道琼斯评论称,他们:
“赞赏像OpenAI这样有原则的公司,这些公司明白,如果我们想要实现人工智能的潜力,诚信和创造力至关重要”,并将Perplexity AI与OpenAI进行对比,称Perplexity AI是“内容剽窃者”。
评论
目前的情况极为模糊。各方都将自己描绘成互联网不可或缺的保护者,然而,他们也在利用所宣称要保护的开放性来创造新的在线收入来源:从Perplexity AI的广告变现和订阅模式(用户为其在Reddit上发布的数据摘要付费),到Reddit推出“互动广告”(让“品牌直接为Reddit的10万多个社区打造定制、互动的广告体验——邀请Reddit用户在广告内部直接参与、体验和探索”)。
与互联网的“恶化”现象相关联,“公共数据”的货币化让我们成为了明显的输家。从知识产权的角度来看,Perplexity专利研究代理的发布可能会引发人们对公开可获取的专利数据商业化的担忧,毕竟公开披露和知识共享在专利制度中具有重要意义。
作为人工智能下游应用的“先行者”,Perplexity AI处于独特地位,正在塑造版权和数据可及性的未来。尽管本文作者喜欢这些生动的比喻,但Perplexity AI的诉讼和授权协议使关键公共政策问题脱离了更广泛的公众讨论。这也限制了我们对生成式人工智能更广泛的社会文化影响以及可能完全超越版权法边界的新发展路径的理解。
《四季变幻》(Four Seasons in One Day)在本文作者心中有着特殊地位。拥挤之家(Crowded House)乐队在这首歌中唱到乌云上有阳光,多种感受并存;一个人在一天内能体验四季。虽然他们不愿预测天气,但似乎Perplexity AI在历经多次风暴后依然掌控着航向,看来大胆预测确实能有所回报。
来源:https://ipkitten.blogspot.com/2025/11/it-doesnt-pay-to-make-predictions-or.html
本文原文为英文,中文为机器翻译,仅供参考,如有问题或建议,欢迎随时与我们联系。