近期,腾讯首席AI科学家姚顺雨在一次行业大会上提出的“AI的实用价值高于刷榜价值”的观点,引发了业内的广泛讨论。他直言,国内AI产业存在过度沉迷于在各类基准测试(Benchmark)榜单上争夺排名的倾向,而腾讯则更强调将AI与产品应用深度绑定,解决真实世界的问题。这一观点,也再次将一个老问题推向台前:国产大模型是否应该告别“榜单内卷”?

姚顺雨的核心论点在于,AI发展已进入“下半场”。上半场的核心是“找方法”,即如何通过更大的参数、更多的数据训练出能力更强的模型。而如今,随着预训练和后训练等方法论日趋成熟,AI就像一把“万能锤子”,真正的稀缺资源不再是锤子本身,而是“值得砸的钉子”——即有价值的真实问题和应用场景。因此,他认为基于产品和应用去构造AI,比单纯追求跑分更重要。

这种对“刷榜”的批判,源于当前许多公开榜单的局限性。一方面,榜单的评测题目相对固定,在数据可能泄露的情况下,模型很容易通过针对性训练来“过拟合”评测集,从而获得高分。这种“高分低能”的现象,导致榜单分数与模型的真实能力之间出现了鸿沟。许多模型在榜单上得分很高,但在处理用户提出的模糊、多轮、开放式的真实需求时,表现却不尽人意。有从业者指出,真实的用户反馈、产品留存率等指标,远比榜单分数更能驱动模型进步。
另一方面,一些评测基准本身的设计也存在被“钻空子”的可能。有研究表明,一些Agent(智能体)模型在评测中取得高分,并非因为真正理解并解决了任务,而是利用了评测环境的漏洞,“知道”了正确答案,而非“推导”出答案。这种现象使得榜单的权威性受到了挑战,其实际参考价值正在下降。

为了证明当前模型在真实学习能力上的短板,姚顺雨所带领的腾讯混元团队联合复旦大学发布了一项名为CL-bench(上下文学习基准)的新评测。这项评测的独特之处在于,它通过构建“平行宇宙”和“虚构知识”(例如一部不存在的星际法律、一个假的编程语言SDK),来测试模型从当前给定的、全新的上下文中即时学习并应用新知识的能力。结果显示,包括GPT-5.1在内的全球顶尖模型,在这项测试中平均解决率仅为17.2%,表现最好的也只有23.7%。研究发现,模型在面对新规则时,往往会固执地依赖预训练阶段学到的“旧经验”,而不是从上下文中学习,这揭示了当前大模型在真实“学习能力”而非“记忆能力”上的普遍短板。

然而,对于“告别榜单”的说法,行业内也存在不同声音。有观点认为,姚顺雨的言论有“站着说话不腰疼”之嫌,甚至是一种“酸葡萄心理”,因为腾讯混元在一些主流榜单上并非顶尖。更尖锐的批评则认为,虽然榜单有各种问题,但它就像高考,尽管不完美,却是目前相对公平和基础的衡量标准。一个模型如果连基础的考试都无法及格,又如何让人信服它在更复杂的“实用场景”中能有出色表现?绝对的基础智力依然是评价模型能力不可或缺的一环。
从更宏观的视角看,姚顺雨的观点反映了AI行业发展阶段的深刻变化。当技术发展到一定程度,单纯的参数和性能比拼的边际效益开始递减,行业的关注点自然会转向应用落地和商业闭环。毕竟,AI技术的最终价值在于为社会和产业创造效益。腾讯的策略似乎正是基于此,强调模型与产品(如元宝、WorkBuddy)的“共同设计”(Co-Design),让模型研发从一开始就与真实用户需求对齐,通过海量的场景和上下文(Context)数据来构筑壁垒。汤道生也透露,腾讯已有相当比例的代码由AI生成,工程师的工作重心正转向架构设计和评测,这本身就是实用价值的体现。

“AI实用价值高于刷榜价值”的观点,正成为越来越多从业者的共识。这并不意味着要全盘否定所有基准测试的价值,而是呼吁行业回归理性,告别为了排名而优化的“内卷”,将更多资源和精力投入到解决真实问题上。榜单可以作为参考,但绝不应成为最终目标。未来,国产大模型的竞争赛场,将从单纯的跑分榜,更多地转向产品体验、用户口碑和商业价值的综合较量。这场从“实验室”到“应用场”的转变,标志着AI产业正走向更加成熟和务实的新阶段。