研究发现,世界著名大模型的记忆能力超群,超过法律允许范围

源自今日头条:人工智能学家

02-25 11:16

顶尖大模型被指“学习”实为“记忆”,斯坦福与耶鲁最新研究显示,GPT-4等模型能近乎完美复现受版权保护小说。这一发现动摇了AI公司的核心法律辩护,可能引发数十亿美元赔偿,并重新定义AI数据使用的合规边界。

研究发现,世界著名大模型的记忆能力超群,超过法律允许范围智能速览

  • 斯坦福耶鲁联合研究证实顶尖大模型记忆版权内容

  • Claude复现《1984》精度超94%,远超此前认知

  • “记忆”而非“学习”结论动摇AI公司合理使用辩护

  • 新证据可能引发巨额法律责任及欧美监管审查

  • 行业加速版权谈判与技术遗忘机制研发

研究发现,世界著名大模型的记忆能力超群,超过法律允许范围精华内容

当AI能一字不差背出《1984》时,关于“学习”与“复制”的界限已被打破,这场关乎数十亿美元的博弈有了新筹码。

惊人的复现精度

研究团队对GPT-4.1、Gemini 2.5 Pro等四款模型测试发现,其对受版权保护内容的记忆程度远超预期。通过“Best-of-N”提取技术反复提问,Claude对奥威尔《1984》的复现精度超过94%,Gemini生成《哈利·波特》的准确率接近77%。数据表明,这种长段且精准的逐字生成绝非概率巧合,而是模型内部存储了“记忆”。

法律盾牌的裂痕

AI公司长期以“学习”而非“复制”作为核心法律盾牌,主张像人类阅读一样吸收概念而非复制原文。然而,新证据显示模型能稳定生成近乎完整的原著内容,这与“不构成实质性替代”的合理使用前提相悖。尽管企业辩称这是非正常使用,但模型本身具备的完整复现能力,已在法律层面构成了实质性风险。

行业面临巨变

这一研究被视作法庭级别的“决定性证据”,可能给行业带来数十亿美元赔偿压力。此前Bartz案的裁决虽给AI公司带来安慰,但新证据动摇了其基础。面对欧美监管压力,企业正加速与出版商谈判授权,同时研发去重与遗忘机制。这关乎AI数据海洋究竟是全人类资源还是付费知识产权的最终定性。

这场关于记忆与版权的争论,将重塑AI行业的数据生态。究竟是开放的学习还是付费的特权?技术狂奔之下,法律与伦理的边界正在被重新审视,未来数据的使用成本或许将大幅上升。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章