OpenAI的"亲儿子"换底Kimi、再融5.5亿美元:法律AI涌进律所这个月,执业人先拆穿三个数字

源自37位全网作者

06:11

8月25日,OpenAI投资、全球估值最高的法律AI公司Harvey发布首个自研法律行业模型Tenet,底座不是GPT,是月之暗面的开源模型Kimi K3。9月9日,Harvey官宣完成5.5亿美元新融资,估值升到156亿美元。同一周,它连着收购两家法律科技基础设施厂商,还发布了从接洽到结案的端到端Agent"Archie"。 如果你是执业律师或法务,这两周大概率也经历了同款场面:群里在传"OpenAI亲儿子反水",所里已经来了第三拨卖AI产品的人。要不要跟、怎么跟,比喊口号更有用的,是先拆穿三个数字。小红书小红书知乎

一、26.7%:先看穿"碾压"标题的读法

Harvey官方发布里最常被引用的成绩:Tenet任务全通过率19.7%,K3基座10.8%。Kimi官方账号又引了Artificial Analysis的数据:Harvey LAB基准上,K3从上一代K2.6的0分跳到26.7%;但同一张榜单还有一个94.6%的分数。知乎小红书

Kimi K3法律基准得分图Kimi K3法律基准得分图

同一个模型,为什么既94.6%又26.7%?因为两个指标回答的是两个问题:前者是"所有评分标准里通过了多少条",后者是"多少个任务零遗漏地完成"。一项任务平均约50条验收标准、大任务数百条,漏一条,整个任务就不算完整完成。行客科技那篇拆解写得直白:看到"法律基准第一",先问一句按什么指标。知乎

这对办业务的意义有两条,方向正好相反:

  • 别神化。即使按当前最好成绩,能完全独立交付的任务也只占四分之一上下。"AI只能当起点、终稿必须过人的手"这条老规矩,这个月没有被推翻。

  • 但投入的方向变了。Harvey做了对照实验:同一个K3,只换执行框架——工具接口、文件挂载、执行循环——得分差8.7分;在同一环境里做后训练,又只抬了6.5分。Agent能力是"模型×工作环境"的乘积,行业护城河已经从"生成得多快"挪到"会不会组织工作、能不能被律师按清单验收"。Harvey自己9月9日的动作就是佐证:收购对准工作流底层设施,Archie主打连续执行,战场已经不是对话框。知乎

二、156亿美元:钱投票的不是模型,是"数据不出域"

为什么换成中国开源模型?社区玩梗叫"反水",也有人说是"套壳"。但法律行业真正认的理由朴素得多:私有化部署、数据隔离、数据不出域。

Kimi官方帖的评论区,有律师的吐槽一针见血:“客户要求私有化部署,只能Kimi了”。知乎上法律AI从业者的行业访谈更直接:律所和法务部对隐私、数据隔离要求非常高,公司网络不会去翻墙,海外闭源模型根本进不了门。实习律师用得很凶,资历老的大律师大多观望甚至抗拒;大家真正的需求清单是搜法规案例、行业研究、企业背调——每一项都要可溯源。小红书知乎

再看Harvey侧的账本:官方披露它已服务70多个国家2400余家律所与企业法务、20万以上法律从业者,覆盖超过七成半的AmLaw 100顶级律所,手里攥着SOC 2 Type II、ISO 27001、GDPR这些安全合规认证。它卖的一直不是更聪明的对话框,而是"敢进你办案流程"的资格。Kimi同时宣布多家红圈所已给员工配备Kimi企业版(厂商口径),卖点是个人账号与企业账号数据分离。知乎小红书

Harvey产品界面截图Harvey产品界面截图

所以"OpenAI亲儿子用Kimi"不是情绪新闻,是一次行业投票:开放权重底座+后训练+环境工程这条路,被最挑剔的客户群认了。轮到你自己选型,决策点也随之换掉了——不比"哪个模型更聪明",比三件事:数据能不能不出域、引用能不能点回原文、你们所自己的审查清单能不能配置进去。

三、“两个任务五小时”:真实消耗,没人替你算

下单之前,先看两个实测样本。

上海一位诉讼律师9月6日实测Codex里的新模型:起草能力、对中国法条时效和溯及力的判断"明显惊喜",喂几篇参考稿就能复刻自己的写作风格;但"消耗太离谱",xhigh模式下基本上两个任务五小时就把用量打满了。另一位法律号7月17日横评三个模型做起诉状:格式和简洁度Kimi明显占优、还自动附了证据目录(它吃进了大量裁判文书),GPT反而在利息计算上出错;结论是从国产、价格和未来趋势看,没必要强推外国模型。小红书小红书

诉讼律师AI实测文书图诉讼律师AI实测文书图

额度吐槽则是评论区的高频词:“一周的额度只能用三四天”“699的订阅额度为什么只有99的5倍”“一个分析报告出来就干废了”。所以个人执业人的第一课不是买更贵的套餐,而是把任务分级:检索、初稿、整理这类小活,免费版或网页档跑;合同批审、时间线、尽调底稿这类大活,一天只开一两单重任务;除非确实要深推理,别默认拉满xhigh——这个钱,是被重Agent模式烧掉的。小红书

比订阅贵的是返工。今年夏天湖北宜昌西陵区法院一起庭审里,代理律师交的AI辅助参考案例五份有四处问题:真案例配了假裁判要旨、假案号配假案例、真案号张冠李戴、连司法解释条文都被篡改——法官当庭上裁判文书网查案号、拿原文逐条比对,当庭训诫。9月7日,最高法发布24条涉AI纠纷裁判意见,AI产出物的责任口径正在被写进裁判规则。不管条文最后怎么落,签字的那一栏是你的名字,不是模型的。知乎知乎

四、把这套分工和核验SOP直接抄走

交给AI的:合同条款初筛(要求输出Word修订模式、能逐条采纳或拒绝的,不是聊天框里一大段)、案件时间线整理、类案检索和法律研究初稿、行业研究、企业背调、客户邮件总结。社区实测里"法律检索2小时压到5分钟"是常态。

Word红线逐条批注界面Word红线逐条批注界面

不交给AI的:争议焦点的取舍判断、提交法院的一切终稿、庭上的临场回应。

买前问三句:检索结果附不附法条文号和案号、点开是不是原文;有没有企业版/私有化或至少可脱敏的选项;交付物格式是不是"批注+修订+三档风险分级"。

交稿前查三处:案号上裁判文书网逐条查,重点核"真案号假要旨"这种最阴的形态——判决理由要和原文对,不是案号真就完事;法条对现行有效全文,防修订和废止;利息、违约金这类计算,人工算一遍,或换第二个模型交叉验证。

接下来三周值得盯的信号

国内法律垂类产品接不接北大法宝、企查查这类权威数据源(Kimi评论区已经在点名要了,华宇元典法律数据库已接入);Tenet下一轮公开基准成绩,重点看"零遗漏完成率"而不是平均分;以及律所采购潮会不会从"销售上门"变成"所内试用额度"——今年被第三拨销售堵在会议室的那位朋友怎么反应,比发布会更有信息量。

有句从业者评论值得留着:问题早就不是"要不要用AI",而是慢一步,别人把你脑子里那条清单做成产品卖回给你;快一步,你自己把它攥成能反复调用的工作方式。小红书

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章