当前位置:
AIGC文章详情

有人说Kimi变笨了,也有人说它从未如此好用:我们核对了全网十几条实测,发现分歧出处很集中

源自38位全网作者

06:12

这周Kimi的评论区有点吵。

8月24日,月之暗面官宣,第一代万亿参数模型Kimi K2.5本月底结束服役,K3全面接棒。知乎腾讯云那边也发了通知,K2.5的API接口8月31日零点起停服。知乎按官方说法,K2.5从发布到退役不到一年。

几乎同一时间,用户社区里吵成了两派。一派说"Kimi变笨了",另一派说"K3之后从未如此好用"。同一个产品、同一个模型,评价完全相反——这事本身就值得掰扯一下。我把知乎、小红书、36氪上这两周的实测和吐槽都翻了一遍,结论先放这儿:两派说的可能都是真的,分歧不在模型"强弱",而在任务类型和用法的错配。

吐槽派和真香派,手里都有实锤

先看吐槽派,这周的案例都很具体:

一位做公募二级投研的用户说,K3刚接上的第一周表现惊艳,一周后明显感觉它做分析类工作比之前"敷衍了很多",就算提醒它按第一周的标准来,也只是僵硬的模仿。小红书一位个人站长吐槽,升级K3后恢复网站数据库这种活,以前几分钟搞定,现在半个多小时都搞不定。小红书还有一位博士生,刚买的次顶配月额度,被一个复杂任务一次性烧完,直呼消耗太快。

再看真香派,证据同样具体:

有科研用户晒出用K3写论文的流程——把批量文献一次性丢进去,靠百万token上下文梳理综述逻辑、打磨学术表达,一路拿到接收。小红书有开发者拿同一个多文件重构项目横测kimi-k3、GPT-5.6和Claude Sonnet,结论是K3在多文件上下文保持和工具调用成功率上超出预期。知乎还有重度用户的评价很有代表性——“特别厉害、特别慢、特别贵”,账单镇楼,但下个项目还是打算接着用。知乎企业端也有声音,一位用户说自己公司唯一允许使用的中国模型就是Kimi,比竞品好还便宜。

还有一条今天的新闻可以当注脚:OpenAI投资、估值110亿美元的法律AI公司Harvey,官宣首个自研模型Tenet,底座选的就是中国开源模型Kimi K3。知乎它用约150块B300训了两个月,在Harvey自建的法律基准上全通过率比K3底座提升82%,推理成本不到主流前沿模型的四分之一。全球客单价最高、对错误最零容忍的行业,第一次自研模型选了中国开源底座。

有人说Kimi变笨了,也有人说它从未如此好用:我们核对了全网十几条实测,发现分歧出处很集中

所以"Kimi整体变弱了"这个判断,证据是站不住的。但吐槽派的体验也是真实的。问题出在哪?

分歧的出处,集中在三件事上

第一,K3是"想得多"的推理型模型,额度消耗逻辑变了。

K3这类模型在干活前会先生成大量内部推理内容,复杂任务的token消耗天然比上一代高。更关键的是,有用户实测发现:任务一旦提交,哪怕你中途断开、页面卡住,服务器端的推理还在继续,token照算。知乎这就是为什么"一个任务烧掉一个月额度"的惨案会发生——不是额度偷偷缩水,是复杂任务在推理型模型上的消耗量级本来就变了。

第二,输出风格变了,有人把"风格差异"体验成了"降智"。

吐槽派的重灾区集中在分析类、开放式问答:K3在这类任务上有时给得更收敛、更短,老用户按K2.5时代的预期看,就觉得"敷衍"。但注意,这个观察目前只有个案和体感,官方没有承认过输出策略调整,也可能叠加了高峰期集群算力波动,有用户反映Kimi时常繁忙。小红书能确定的是:把需求写得越具体——篇幅、深度、格式、分析维度——K3的输出质量越稳定;丢一句模糊的问题等它发挥,翻车概率明显更高。

第三,Kimi的额度规则本身就容易让人误判。

有付费用户梳理过,Kimi的额度是"5小时、周、月"三层滚动限制,而且周额度和月额度是独立滚动的——你可能月额度刚刷新,周额度还没恢复,这时提交大任务就会突然被限住。知乎再叠加K3更高的单次消耗,"关键时刻没额度"的挫败感会被放大。这不是被针对,是规则和消耗模式叠加后的必然结果,但确实应该被说清楚。

有人说Kimi变笨了,也有人说它从未如此好用:我们核对了全网十几条实测,发现分歧出处很集中

现在的Kimi,什么活值得派给它

把全网实测摆在一起,K3的能力分布其实挺清晰的:

适配度高的:长文档处理(百万token上下文是看家本领,合同审查、文献综述、财报精读);论文写作与返修;编程里的多文件重构、工具调用类任务;需要长链条推理的深度调研。

建议谨慎的:短平快的简单问答——用推理型模型回"这个单词什么意思",又慢又耗额度;对输出篇幅敏感又不写清楚要求的任务;以及高峰时段的超大任务,撞上限流和繁忙,体验会大打折扣。

三个马上能用的调整:复杂任务拆成几步分阶段确认,别一次性扔个巨型需求;提交前先看一眼周额度余量,避免大任务卡在额度边界;开放式分析任务,在提示词里直接写明你要的篇幅、结构和深度。

接下来该关注什么

眼下的时间线很明确:8月31日K2.5的API停服,主要影响开发者;只用Kimi App和网页版聊天的用户,模型切换是自动的,不需要操作,但如果你的使用习惯还停留在K2.5时代,值得按上面的方式调整一下用法。另外,目前Kimi会员购买收紧、需要预约抢档,有续费打算的可以留意放量节奏,不必为焦虑提前囤。这次接棒的背景,是开源模型的参数规模一路水涨船高,K3以2.8万亿总参数成为目前全球最大的开放权重模型。知乎下一代模型据传已在第三方平台露面,官方版本的节奏会影响现有套餐的含金量。往后值得盯三个信号:一是新一代模型的正式动向;二是集群扩容情况,"繁忙"是否缓解直接决定付费体验的下限;三是国产大模型8月集体涨价的背景下,Kimi会员定价和额度规则会不会跟着调整。

有人说Kimi变笨了,也有人说它从未如此好用:我们核对了全网十几条实测,发现分歧出处很集中

一句话总结:现在的Kimi,上限被Harvey这种顶级买家验证过了,但它不是"无脑好用"的模型——会用的人觉得它从未如此强大,沿用老习惯的人觉得它变笨变贵。这篇里的三件事——消耗逻辑、提示词写法、额度规则——搞清楚,你就在前一类用户里。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章