当前位置:
AIGC文章详情

Harvey用150张卡、2个月,在Kimi K3上训出首个自研模型:先别急着喊"叛变",看懂这笔账再说

源自47位全网作者

03:56

这个周末,AI圈出了件挺有意思的事。

全球估值最高的法律AI公司Harvey,发布了首个自研训练模型Tenet。Harvey官网这本身不算爆炸,爆炸的是:Tenet的底座不是GPT,不是Claude,而是月之暗面的中国开源模型Kimi K3。微博

然后大家看到的画风就是:刷屏两天,标题全是"OpenAI亲儿子反水"“叛变”。确实有戏剧性——OpenAI创业基金领投过Harvey的种子轮,这家公司第一个自己训的模型,用了中国底座。

但只停留在"叛变"两个字,大概会错过这件事八成的信息量。Harvey做的这个决定,与其说是一次站队,不如说是给所有垂直AI公司算明白了一笔账。今天把这笔账拆开看看。

Harvey用150张卡、2个月,在Kimi K3上训出首个自研模型:先别急着喊

Harvey是谁,为什么它的选择有分量

先给不熟悉的朋友补几个数字。这家公司成立只有4年,去年底估值80亿美元,今年3月涨到110亿美元,最新一轮据说在谈155亿美元的估值。36氪它服务1300家机构、超过10万名律师,覆盖60个国家,客户名单里有全球最大律所Latham & Watkins、汇丰、普华永道、桥水、KKR。微博

还有一个数字最关键:Harvey每月要处理13万亿token,而且每一个token都是从OpenAI、Anthropic、谷歌的闭源API那里买来的。36氪

法律服务是全球客单价最高、对错误最零容忍的行业之一,一份尽调备忘录漏一条风险,下游可能就是几千万美元的官司。这样的公司选底座的挑剔程度比谁都高,所以它的选择才有参考价值。

为什么非要自己训:不是叛变,是被逼的

Harvey之前的打法很标准:买三家闭源大厂的API,按客户需求路由分发。做应用层嘛,底层能力花钱买,天经地义。但卖东西的人开始惦记它的生意了:OpenAI挖走了合同管理公司Ironclad的创始人Jason Boehmig,去领导OpenAI自己的法律业务;Anthropic推出了面向律师的文档审查插件。36氪

Harvey联合创始人Gabe Pereyra说得很直白:这不是"供应商",这是"未来的竞争对手"。36氪今天卖你API的人,明天就坐在你客户的会议室里。更麻烦的是成本完全不受控——模型厂说涨价就涨价,垂直公司连讨价还价的资格都没有。

还有一层是能力上的差距。通用模型能回答法律知识,却未必完成得了真实的法律活:律师接到的不是一道问答题,而是合伙人一句话加一堆真假线索混杂的卷宗,模型得自己判断从哪下手、连续检索、发现风险、给出引用,最后交出能用的文书。这种"怎么做、怎么检查"的判断力,靠提示词和工作流传不进去,只能靠训练。美国法院最近就连着被AI摆了几道:有法官助理用AI起草裁定,结果引用是虚构的,连当事人名字都写错了。微博

Harvey用150张卡、2个月,在Kimi K3上训出首个自研模型:先别急着喊

更夸张的是,还有法院收到当事人藏着白色小字的诉状,专门写给读文件的AI看,要求它支持自己的诉求。微博行业对"能干活的模型"的需求,是真实存在的。

怎么训的:150张卡、2个月、律师当教练

Tenet的训练方式值得单独说,因为它演示了一条门槛没那么高的"造模型"路径:

  • 底座:Kimi K3,2.8万亿参数MoE架构,100万token上下文,原生多模态,是目前全球最大的开放权重模型。36氪

  • 算力:约150块NVIDIA B300,跑了两个月。作为对比,从头预训练一个前沿模型要几万张卡、烧数亿美元以上——Harvey这相当于在别人盖好的楼上做精装修。

  • 方法:异步强化学习。请执业律师编案子:虚构一桩并购纠纷、凑一堆合同文件,让模型上手干;干完律师逐条审,风险漏没漏、判例引对没有、逻辑站不站得住,几十条"过/不过"的硬杠杠,差一条整个任务判零。

按Harvey自建并已开源的法律基准LAB来算,Tenet相对K3底座,全通过率提升82%。任务完成数接近翻倍。知乎Contracts子榜排第一,总榜第二。

Harvey用150张卡、2个月,在Kimi K3上训出首个自研模型:先别急着喊

合作方Mercor拿公司法任务测了一轮,Tenet比基座高出15分,直接拿了第一。36氪

更实在的是成本:Tenet的推理成本不到主流前沿模型的四分之一。36氪

为什么是Kimi K3:不是情怀,是裸考成绩

很多人会问:模型那么多,为什么偏偏是中国的开源模型?

第一层是裸考成绩。在第三方评测机构Artificial Analysis跑的Harvey LAB-AA法律基准上,按最严格的"全通过率"口径,Kimi K3拿到26.7%,差不多是Fable 5(14.2%)的两倍。36氪也就是说,在Harvey自己出的这张法律卷子上,裸考成绩最好的就是K3。

Harvey用150张卡、2个月,在Kimi K3上训出首个自研模型:先别急着喊

第二层是能拆开改。闭源模型再强,权重锁在API后面,你只能写提示词,碰不到模型骨架;K3的权重完全公开,Harvey拿LoRA深入到50万个专家张量里做手术。36氪100万token的上下文也天然贴法律场景——一个并购案的卷宗动辄几千万token,窗口不够连材料都塞不进去。

而且Harvey不是第一个。往前翻几个月:AI编程头部Cursor发布"自研"模型Composer 2,三天后被开发者从API里扒出模型ID是kimi-k2p5-rl-0317,底座是Kimi K2.5,联创后来承认了。36氪AI搜索头部Perplexity在K2开源后随即启动后训练;连OpenAI前CTO Mira Murati创办的Thinking Machines,也把Kimi K2 Thinking接进了自家微调产品Tinker。

编程、搜索、法律一路排下来,开源模型已经悄悄进了美国AI产品的地基。知乎CNBC曾报道,美国企业在OpenRouter上的中国模型token用量一度占到46%,DoorDash、Airbnb都在用中国模型控成本。36氪榜单是面子,供应链才是里子。

把"叛变"叙事里的噪音去掉

刷屏文喊"叛变"喊得很响,但有三点得说清楚。

第一,Tenet不是替代。Harvey的平台依然接入Claude Opus 5和GPT-5.6 Sol,Tenet只是多出来的一个自有选项。36氪而这个选项本身就是筹码:手里有一个自己能改、成本只有四分之一的模型,再去和API厂商谈价格,姿态完全不一样。

第二,Harvey本来就不是"只用OpenAI"的公司。它从第一天起就是多模型路由,OpenAI只是投资人之一。“反水"是流量叙事,真实的变化是:垂直公司的议价结构,从"别人卖什么买什么”,变成了"我自己也造得出来"。

第三,这条路也不是没有代价。知乎上有句话说得准:底座捏在别人手里,人家哪天升级或者收紧权重授权条款,上面盖的楼全得抖。知乎Harvey赌的是K3开源授权的长期稳定,这个赌注本身值得持续观察。

谁该紧张,接下来盯什么

对做垂直AI的人来说:Harvey演示了一条可复制的路径——开放权重底座+行业专家反馈+后训练,门槛是150张卡和两个月。底座越来越像工业原材料,真正的壁垒在行业工作流、专家判断和部署经济性上。Harvey已经放话,下一步要把算力从1000卡扩到10000卡做全参数微调,目标是"每家律所都能有自己的专有模型"。36氪医疗、金融、工程都在看着。

对普通用户来说:这是好事。闭源厂商已经被逼着动了——发布才三周的GPT-5.6 Luna,7月30日就迎来大幅降价,API端的降价潮今年已经来了好几轮。36氪竞争才刚开始。

后面还有两个信号值得盯:一是会不会有第二个行业跟进,"主权模型"从个案变成潮流;二是昨夜开始,社交平台流传月之暗面正就Kimi K3与微软、亚马逊、谷歌谈收入分成,最高30%——消息未经官方证实,先当传闻看。但如果把它和Harvey这事放在一起,中国开源模型"出海当底座"的故事,可能真的才刚开始。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章