知识权威的绝地反击:大英百科状告ChatGPT,直指AI实时检索侵权
近日,拥有悠久历史的《大英百科全书》(Britannica)及其旗下的韦氏词典(Merriam-Webster)向法院提起了对人工智能公司OpenAI的诉讼,指控其开发和运营的ChatGPT服务构成了大规模的版权侵权。
这起诉讼的核心,是《大英百科全书》提出的四项主要指控。原告方认为OpenAI在未经许可的情况下,抓取了其旗下近十万篇拥有版权的百科文章与词典条目,并将这些内容用于训练大语言模型。他们指出ChatGPT在生成内容时,能够输出与《大英百科全书》原文几乎逐字逐句的复制品,这构成了直接的版权侵犯,表明模型不仅仅是在“学习”规律,更是在“记忆”和“背诵”受版权保护的内容。

更具争议性的是第三项指控,它首次将矛头指向了AI的实时信息检索技术(RAG)。《大英百科全书》主张,即便其内容未被用于模型的初始训练,但只要ChatGPT通过其实时联网功能检索并调用了这些受版权保护的文章来回答用户提问,这一行为本身就构成了侵权。这一观点将侵权的范围从静态的训练数据扩展到了动态的实时调用,如果被法院认可,将对所有依赖联网搜索获取信息的AI产品产生深远影响。
《大英百科全书》还依据商标法提出了第四项指控。他们认为,ChatGPT在生成信息时偶尔会出现“幻觉”(即编造不实信息),并错误地将这些虚假内容的来源归于《大英百科全书》,这不仅是侵权行为,更损害了其品牌多年来建立的权威性和可信赖度。
这起诉讼并非孤例,它反映了当前全球范围内内容创作者与AI技术公司之间日益激烈的法律博弈。事实上,包括《纽约时报》、多家美国和加拿大的报纸集团以及环球音乐等音乐版权巨头在内的众多机构,都已对OpenAI或其他AI公司提起了类似的诉讼。而《大英百科全书》在起诉OpenAI之前,也曾对以RAG技术为核心的AI搜索公司Perplexity提起过诉讼,此举被外界看作是其在为这场更关键的官司进行法律策略上的“预演”。
目前,关于使用受版权保护的内容训练AI模型是否合法的法律问题,在全球司法界尚未形成统一的定论。例如,德国法院曾在一宗案件中认定,AI模型权重中嵌入歌词构成侵权;而英国法院在另一起案件中则认为,模型权重存储的是规律模式而非作品副本,不构成侵权。在美国,虽有法官认可AI训练属于“合理使用”中的“转换性使用”,但也曾因AI公司非法获取训练数据的方式而判定其违法。
这起诉讼的背后,是传统知识权威与新兴技术之间商业模式的直接冲突。《大英百科全书》认为,ChatGPT通过生成替代性的内容,直接抢夺了本应属于内容出版商的网站流量和收入。作为一个拥有超过250年历史的知识品牌,它正试图通过法律手段,在人工智能时代重新划定知识产权的边界,并确保其创造的价值能得到应有的回报。该案的最终判决,无疑将对整个人工智能行业的未来发展和商业模式产生关键性的影响。
