最近小红书上有个略显落寞的提问:文心入局早,但现在谈论它的感觉寥寥无几,有没有现在还在深度使用的人来说一下感受啊?小红书这个问题值得琢磨:最近一个月几乎从讨论里消失的文心,其实悄悄连拿了两个第一。SuperCLUE最新一期XClaw「龙虾」测评战况出炉,在十大国产「龙虾」的同台厮杀中,唯有文心助手一举斩获了97.62最高分。知乎PinchBench v2的7月结果页上,百度AI搜索任务化模式也以Best Score 94.6%、Average Score 94.4%排在当时榜单快照的第一位。知乎更关键的是,这两个第一至今都免费、不限量。
值得写它,是因为榜单和口碑的反差实在太大。不少人对文心的印象还停留在两年前那个略显拉胯的文心一言,不太确定现在值不值得回坑。这篇把榜单、真相和适用人群一次说清。
两个榜单,到底考的是什么
先说清楚:这两张榜单考的不是聊天,是干活。SuperCLUE-XClaw的评测逻辑就一条——不要选择题,只看交付题,模型必须按指令交出最终成果,没有取巧空间。最新一期成绩里,文心助手记忆能力直接斩获100分,数据处理98.86分位列第一,内容创作99.44分,研究分析96.44分。知乎但先别急着下碾压的结论。SuperCLUE 将分差一分以内视为并列,因此 96.74 分的 MiMoClaw 也显示为第一。知乎文心拿的是综合分最高,并没有把第二名甩开一个身位。它真正的优势是没有明显短板:五个维度四项超过96分,最低代码开发也有90.28分。对任务助手来说,均衡比某一题特别会更重要,因为一次真实任务往往同时要查资料、读文件、写内容、算数据、记住前文,任何一环掉链子,交付物就是半成品。

第二张榜单PinchBench v2更接近验收:把CSV、PDF合同、混杂日志这些原始文件丢给Agent,让它自己规划、调用工具,最后直接验证文件是否生成、格式对不对、数值准不准。在百度公开的结果仓库里,排在其后的包括 Claude Opus 4.8-fast 和 Qwen3.7-max。知乎

拆开分类看,门道更清楚:日志分析98.7%、会议文档分析96.5%、数据与财务分析96.2%、代码开发与运维93.0%,高分项全都有明确的输入、输出和验收条件;而研究与知识获取一类的得分则是 79.5%。知乎这个差距恰好点破了高分的来源:边界清晰的任务,它已经能稳定交卷。
两张榜单放在一起,能画出一个比较清晰的轮廓:现在的文心,把清晰边界内的事做完这件事已经做得很硬,但开放性研究还没到让人放心交差的程度。看懂这句话,才能看懂口碑和榜单的落差。
榜单和口碑,为什么差这么多
要说口碑,得承认文心起手最早。2023年3月发布的文心一言,是国内首个正式发布的大语言模型产品,比阿里通义千问早了半个月,比字节豆包早了整整八个月。知乎
但先发优势被一连串被动动作消耗掉了:2025年初被DeepSeek冲击,4月全面免费,6月开源ERNIE 4.5,产品名字三度更迭。根据QuestMobile数据,文心一言独立App的月活在2025年Q1还有996万,到了Q4,这个数字变成了517万。知乎它跌出AI应用月活TOP10,而同一个季度豆包的月活涨到了2.26亿。很多人对文心不太行的印象,就停在了这里。
转折发生在2026年。百度放弃了把文心一言做成独立超级App的路线,改走入口战略:2026年初,百度内部启动了代号为“O计划”的战略项目,核心逻辑是百度App成为唯一AI入口,文心助手内置其中,搜索引擎转型为智能体调度平台。知乎这步棋的效果很直接:3月3日,QuestMobile最新发布的《AI应用层发展核心报告》显示,百度文心助手月活跃用户规模高达3.6亿,稳居行业第一。知乎但说穿了,这3.6亿更多是入口导出来的——借百度App超7亿月活的用户基础,不用下载就能用。据百度方面数据,文心助手MAU同比增长4倍,可这和用户主动选择文心,仍然是两回事。这也解释了开头那个提问:用户规模是真的,品牌心智也还是真的弱。

那它现在到底能干什么
回到最实际的问题:真用起来怎么样?先看实测。研究分析项里有个很有代表性的任务:让它做三维挂谷猜想研究。它并没有盲目输出,先是自己规划了6步研究流程,然后调用多个子智能体并行处理任务,搜索16篇学术资料。知乎最终交付物是一份markdown文档加一个62KB的交互式HTML,可以直接在浏览器里翻阅这段百年数学史。

这类案例在PinchBench的测试里还有不少:多工作表Excel汇总、企业合同关键节点提取、240个交易日股价数据的收益率与最大回撤计算。高分任务的共同点是输入材料已存在、交付形式说得清、完成标准能检查。这基本划出了当前的能力边界:今天的 Agent 已经很擅长在清晰边界内执行,但面对目标模糊、证据冲突和判断标准不统一的研究工作,稳定性仍然会下降。知乎
短板也要明说。闲聊、陪伴、写文案找灵感这类日常高频场景,不是文心现在的主场,社区里也时不时有真实使用的翻车记录。B站有人专门做了测试文心助手合规边界的视频,标题直接让它推荐明显违规的网站,UP主在简介里强调:真实录屏,有倒计时的,一帧没剪。哔哩哔哩这类内容并不能推翻榜单成绩,但提醒一句:榜单分数和日常体感,从来是两条赛道。
谁值得现在回坑
先把结论放出来:现在试错成本接近于零。拿下两个「硬核第一」的顶尖产品,至今免费,不限量。知乎它的主力功能内置在百度App里,不用下载就能用,也有独立App可选。和付费AI订阅不同,你不用纠结一个月能不能用回本,直接丢一个真实任务给它就行。
按人群给几条具体建议:
干活型用户(整理表格、做PPT、写周报、理合同节点):值得优先试,这正好是它得分最高的项目,且免费;
以闲聊、情感文案、找灵感为主的用户:豆包们仍然更合适,文心现在的强项不在这里;
开放研究型(文献综述、行业调研):可以拿它做资料初筛,但关键结论一定要人工复核,研究项79.5%的得分是个实在的参考值;
开发者:文心快码Comate测试版的免费福利第二弹正在进行,即日起至 2026 年 9 月 24 日,下载 Comate 测试版并注册登录,立得 7 天不限量额度,直接解锁超强性能模型。知乎每邀请1位好友还能再得3天,个人最高37天,薅羊毛要趁早。
再补一句提醒:Agent越强,核验越重要。任务型产品出错的代价不是一句答错的话,而是一张公式错位的表、一条读错日期的时间线。交付物越重要,越要保留AI干活、人来验收的习惯。
值得继续盯的信号
模型侧,5月发布的文心 5.1 以 1223 分登上 LMArena 搜索榜国内第一、全球第四,成为唯一上榜的国产模型。小红书百度二十多年的搜索底子,正在被翻译成模型能力。商业侧,2025年全年AI业务收入400亿,同比增长48%。知乎投入没有收缩,方向也从独立App换成了入口加Agent。
对已经离开坑位的人,比起分数,更值得盯三个信号:文心后续版本会不会开源、社区真实口碑能不能扭转、搜索变Agent之后能不能持续接住脏乱的真实任务。下次再看到有人问文心还有没有人在用,可以拿这篇对一对——到那时候,答案大概率比现在清楚得多。