Anthropic指控多家中国AI公司通过海量虚假账号大规模“蒸馏”其模型,引发行业震动。这起事件不仅是企业间的商业摩擦,更将AI领域长期存在的“蒸馏”技术边界、数据产权归属等深层次问题推至台前,揭示了技术高速发展下规则滞后的现状。
智能速览
Anthropic指控DeepSeek等三家公司用超2.4万虚假账号,进行超1600万次交互来蒸馏其模型。
“蒸馏”是AI常见训练技术,但争议点在于其实施的方式与规模。
马斯克公开嘲讽Anthropic,指出其自身也存在数据版权争议,引发“贼喊抓贼”的讨论。
事件焦点在于,大规模系统性抽取模型能力是否构成违规,其产权归属尚无清晰法律标准。
AI模型的训练数据本身来源复杂,这使得模型输出能力的独占性变得难以界定。
精华内容
这场指控的背后,是AI行业技术、商业与规则的激烈碰撞。从具体操作到行业共识,再到马斯克的隔空喊话,每个环节都透露出这个行业在野蛮生长中的尴尬与困境。
指控细节
Anthropic指控DeepSeek、Moonshot AI和MiniMax通过创建超过24,000个虚假账号,进行了约1600万次交互,系统性地抽取其Claude模型的核心能力。
具体来看,DeepSeek被指进行超过15万次交互,侧重于推理能力与思维链数据;Moonshot AI的交互量约340万次,主要聚焦Agent能力与工具调用;而MiniMax的交互量最大,约1300万次,集中在Agent编排与工具使用。
Anthropic将这种行为描述为“hydra cluster”,即高度结构化的批量化请求,认为这已超出正常使用范畴,可能削弱模型的安全护栏。
技术与边界
所谓“蒸馏”,是利用强大“教师模型”的输出来训练更小、成本更低的“学生模型”以复现其能力,这在AI领域是常规操作,用于模型压缩和能力迁移。
然而,本次争议的焦点并非技术本身,而是其应用的方式与规模。如果如指控所言,存在通过虚假账号、代理服务进行的大规模、系统化能力提取,并可能绕过服务条款,那么问题就超越了技术讨论,进入了商业合规与不正当竞争的灰色地带。
目前,从内部优化到基于竞品输出训练模型,行业尚缺乏统一、清晰的界定标准。
舆论漩涡
事件迅速引爆舆论,马斯克在X平台公开嘲讽Anthropic,直言“你偷来的东西被偷了?”,直指其自身曾因训练数据版权问题支付巨额赔偿的历史。
这一观点引发广泛共鸣。许多评论者认为,大模型本身建立在未经明确授权的互联网公开数据之上,其训练数据的合法性至今仍存疑。在此背景下,再以“能力被蒸馏”为由指责竞争对手,立场显得尤为尴尬,被解读为“贼喊抓贼”也不足为奇。
转载的业内观点更指出,Anthropic利用公共数据构建封闭模式获利,如今又想用特殊规则保护自身利润,这种模式在颠覆性技术面前是有害且具腐蚀性的。
规则之困
当模型能力可以通过输出被轻松“迁移”时,问题的核心早已不在技术,而在规则的缺失。大模型输出的数据是否具备明确、可独占的产权属性,目前在全球范围内都没有清晰的法律标准。
从商业常识看,绕过平台规则、大规模抽取核心能力的行为显然容易引发争议。但从技术实践看,包括OpenAI在内的头部企业也都在使用蒸馏技术。关键在于,内部的、用于优化的蒸馏,与外部的、基于竞品的蒸馏,边界究竟在哪里?
这场黑色幽默的互指,最终将AI行业推向了一个必须回答的问题:在技术狂飙突进的时代,我们该如何界定合理使用与系统性掠夺的边界?
Anthropic的指控与马斯克的嘲讽,共同撕开了AI行业光鲜外表下的深层矛盾。技术、商业与伦理的交织,让“蒸馏”从一个技术术语演变为行业公案。未来,如何构建公平、透明的规则,将是决定AI能否健康发展的关键。这个边界,又该如何划定呢?