出版商坚持AI公司应为内容付费,版权案件持续推进

新闻机构针对ChatGPT开发商OpenAI提起的一系列版权侵权诉讼即将进入新阶段,而特朗普政府的介入让人们开始关注:AI公司为训练模型所使用的内容支付授权费用,究竟需要花费多少成本。
这些案件包括《纽约时报》和拥有CNET的Ziff Davis公司提起的诉讼。相关各方本月提交了简报,要求联邦法院就若干问题作出裁决,其中核心问题是OpenAI使用已发表材料的行为是否符合美国版权法下的合理使用原则。
然而,联邦政府提交的一份意见声明称,授权障碍将给AI公司带来负担,这一说法招致了Ziff Davis首席执行官维韦克·沙阿的庭外批评。沙阿在《财富》杂志撰文指出,美国音乐产业每年的版税和授权费用总额不到200亿美元,而OpenAI已向投资者表示,到2030年其计划在计算基础设施上的支出将达到7500亿美元。
沙阿写道,每年向新闻出版商支付大约200亿美元的授权费用,对AI公司而言只是"九牛一毛",但对出版商来说却意义重大。"一个合理的付费机制能够形成优质输入与优质输出的良性循环,让AI用户和公众利益都从中受益。"
OpenAI的一位发言人提及该公司关于此次诉讼的博客文章,文中提到了公司与新闻机构的合作关系。博客写道:"AI系统正在为新闻业和普通美国人带来积极影响。"
延伸阅读:我们都是版权所有者,欢迎来到AI制造的混乱局面
这篇专栏文章发表之际,版权案件冗长的证据开示程序正接近尾声。为便于证据开示,针对OpenAI和微软的多起独立诉讼已被合并交由一位法官审理。目前,各方已将过去几年收集的证据提交给法院,并陈述了初步论点,法院可能会就若干关键问题作出裁决,然后将各案发回相应地区法院进行可能的审判。
在一份联合简报中,新闻出版商——包括Ziff Davis、《纽约时报》和《纽约每日新闻报》——辩称,使用其发表内容训练ChatGPT的行为已经损害了网站流量,并用AI生成的"劣质内容"稀释了市场。
出版商在简报中表示:"如果被告的行为变得普遍且不受限制,会产生什么后果,这一点毫无疑问——因为这种情况已经在发生。ChatGPT在2022年11月发布后的一个效应,就是促使谷歌等其他公司加速推出自己的生成式AI产品,其中最显著的就是谷歌的AI摘要功能。"
延伸阅读:谷歌AI摘要功能的"不当行为"损害出版商利益,诉讼称
OpenAI在其提交的文件中辩称,其使用从互联网抓取的数据构成合理使用,因为这种使用"具有高度转化性,相关作品具有高度事实性,且预训练并未对这些作品的市场或价值造成可识别的损害"。
至于授权问题,OpenAI辩称,由于出版商当时并未使用robots.txt协议(该协议用于告知网络爬虫是否可以访问某个页面)或其他方式屏蔽公司的爬虫程序,因此其对出版商内容的访问属于默示授权。
OpenAI辩称:"几十年来,像谷歌这样的搜索引擎——通过爬取(即复制)互联网上几乎所有网页来构建网络索引——以及其他基于网络的产品和服务,一直依赖于对互联网内容的抓取或爬取。事实上,原告新闻机构自己也在使用网络爬虫。长期以来,这种复制行为一直被理解为默示授权,除非网站所有者通过robots.txt协议等机制选择退出。"
目前许多出版商已经屏蔽OpenAI和其他AI公司的爬虫访问其网站。沙阿在专栏文章中写道,这类障碍和付费墙将变得越来越严苛,限制信息获取,阻碍开放网络的发展。"这一切都是因为我们放任了'授权困难且昂贵'这一错误假设未受到挑战。"
Q&A
Q1:新闻出版商为什么起诉OpenAI?
A:新闻出版商认为OpenAI未经授权使用其发表的内容训练ChatGPT,这种行为损害了网站流量,并用AI生成的低质量内容稀释了市场,因此以版权侵权为由提起诉讼。
Q2:OpenAI为使用新闻内容支付授权费用需要花多少钱?
A:据Ziff Davis首席执行官估算,参照美国音乐产业每年不到200亿美元的授权费用规模,AI公司向新闻出版商支付类似规模的授权费,相对于OpenAI计划到2030年投入7500亿美元的计算基础设施支出而言,只是很小的一部分。
Q3:OpenAI如何为自己使用出版商内容进行辩护?
A:OpenAI认为其对互联网数据的抓取属于合理使用,因为具有高度转化性且未对原作品市场造成实质损害;同时辩称由于出版商当时未通过robots.txt等方式屏蔽其爬虫,因此其访问行为属于默示授权。