这场诉讼直指AI产业底层矛盾——大模型训练依赖海量文本,而优质语料的合法获取成本极高。它不单关乎一家公司,更在试探法律能否为机器学习划定新的版权规则。
智能速览
多名作家在美国加州北区联邦法院起诉英伟达,指控其训练Nemo、Megatron等模型时使用盗版图书数据
原告指称数据源自影子图书馆NAS Archive和Books3,并称英伟达曾讨论访问及提供下载工具
英伟达以‘无直接证据证明实际使用’为由申请驳回诉讼,强调‘讨论不等于实施’
案件核心转向法律难题:AI训练中‘实质性使用’如何举证?复制行为是否必须可追溯到具体作品?
判决结果将影响OpenAI、Meta、Anthropic等所有依赖大规模语料训练的AI公司商业路径
2026年4月2日法院将就驳回动议作出裁决,可能成为AI数据治理的里程碑节点
精华内容
当模型吞下整座图书馆,谁为未授权的知识买单?这场诉讼表面是英伟达与作家的对峙,实则是旧版权体系与新智能范式之间的首次正式交锋。
指控依据
2024年初,十余名作家联合起诉,指出英伟达训练Nemo和Megatron系列模型所用语料,大量来自影子图书馆Books3与NAS Archive。原告提交内部邮件截图显示,英伟达工程师曾评估访问Books3的可行性,并向企业客户分发脚本工具,用于批量下载含盗版内容的The Pile数据集。该数据集公开标注含约19万本受版权保护图书的文本片段。
抗辩逻辑
英伟达于2026年1月29日提交动议,要求法院驳回全部指控。其核心论点为:原告未能提供任何证据表明模型输出可溯源至特定受保护作品,也未证明训练过程中实际加载或复制了原告著作。公司强调,技术团队对数据源的初步调研、风险评估或工具开发,不构成法律意义上的‘复制’或‘公开传播’行为。
行业共性
该案并非孤例。OpenAI被《纽约时报》起诉、Meta因Llama系列陷入多起版权诉讼、Anthropic亦面临类似指控。统计显示,2023–2025年美国已立案AI训练版权纠纷达27起,其中82%涉及图书类语料。根本症结在于:一本畅销书的全文授权费用可达数百万美元,而训练一个千亿参数模型需数百TB文本,合法采购成本远超研发预算。
法律真空
现行《版权法》未明确定义‘训练即使用’的侵权构成要件。美国第九巡回法院在2023年Getty v. Stability AI案中裁定,AI生成图像若未再现原作‘可识别表达’则不侵权;但文本模型训练是否属于‘合理使用’仍无先例。关键分歧在于:模型权重中是否留存受保护作品的‘实质性表达’,以及该留存是否具备法律可追溯性。
两种可能
若法院支持英伟达动议,意味着未来版权方须证明模型输出与特定作品存在‘实质性相似’,而非仅证明数据来源可疑——这将大幅提高维权门槛。反之,若认定‘明知来源非法仍系统性使用’即构成侵权,则AI公司需重建数据供应链,预估训练成本将上升300%以上,中小团队或将彻底退出通用大模型赛道。
这场诉讼最终裁决不会只改变英伟达的命运,它将定义未来十年AI发展的合规底线。当知识被压缩为参数,当学习变成黑箱过程,我们究竟需要怎样的新契约来平衡创新激励与创作者权益?4月2日的听证,或许正是人类为智能时代起草第一份数据宪法的起点。