2025年,大语言模型(LLM)的发展正经历深刻变革。从训练方法的底层革新到人机交互的范式转移,AI不再仅仅是云端聊天机器人,而是开始深度融入本地环境,重塑软件开发与信息消费的模式。理解这些趋势,就是把握未来 computing 的脉搏。
智能速览
训练方法新增RLVR,让模型“想”得更久。
LLM智能参差不齐,benchmark可信度下降。
Cursor验证了LLM应用层的价值,负责专业化改造。
Claude Code开创了AI本地部署的新范式,更安全高效。
Vibe Coding让编程门槛消失,代码变为即弃品。
LLM交互将进入图形化GUI时代,信息消费更直观。
精华内容
这些变革并非孤立发生,它们共同勾勒出一幅AI从“云端大脑”走向“本地智能体”,从“文本工具”进化为“视觉伙伴”的清晰蓝图。
智能进化之辩
2025年,LLM的训练方法不再局限于预训练、SFT和RLHF的传统“三板斧”。新增的RLVR(Reinforcement Learning from Verifiable Rewards)阶段,让模型在能自动判别对错的任务上进行大量练习,消耗了原本用于预训练的算力。这带来了一个关键能力旋钮:允许模型在回答问题时“思考”更长时间,从而提升复杂任务的准确率。
伴随训练方法的变化,业界对LLM“智能”的理解也在重塑。过去用“进化”、“成长”形容AI已不再贴切。LLM的智能更像是“参差不齐”的,在某些特定领域展现出天才般的能力,在另一些领域却表现不佳。这种不均衡源于其与生物截然不同的优化压力,也导致传统评测基准的可信度正在降低,因为它们越来越容易被RLVR等技术“刷分”。
应用层的崛起
Cursor的成功雄辩地证明,在底层大模型和最终用户之间,存在一个极具价值的应用层。这一层并非简单的API套壳,而是承担了关键的“脏活累活”。它负责进行上下文工程,在有限的窗口内决定向模型提供最相关的代码片段;它需要编排和串联多个模型的调用,构建复杂的DAG(有向无环图)以平衡性能与成本;它还提供了专为垂直领域设计的图形界面和自主程度控制滑块。
因此,大模型公司专注于培养“通用大学毕业生”,而Cursor这类应用公司则将这些通才进行组织、培训,使其成为特定领域的“专业人士”,将通用能力部署到具体工作场景中,从而释放巨大价值。
AI入住本地电脑
Claude Code的出现,标志着第一个真正让人信服的AI Agent诞生了。它不仅能将工具使用和推理循环串联以解决复杂问题,更重要的是其部署范式:它直接运行在用户的本地电脑上,使用本地的环境、数据和配置。这与通过网页远程调度云端AI的方式截然不同。
将Agent部署在本地,意味着它能直接访问用户已有的开发环境、私密数据和低延迟上下文,交互效率远超云端。Anthropic率先想通了这一点,将Claude Code打包成简洁的CLI工具,创造出一种全新的交互模式——AI不再是访问的网站,而是“活”在你电脑里的智能体,这是一种根本性的范式转变。
人人皆是程序员
“Vibe Coding”在2025年成为一种现实,标志着AI已跨过能力阈值,能仅通过自然语言描述构建出令人印象深刻的程序。这不仅让编程不再是专业人员的专利,赋能了普通大众,更让专业程序员能够编写大量原本“不会被写出来”的软件。
因为代码突然变得免费、临时且可塑,人们可以快速构建一个一次性工具来解决问题,用完即弃,其成本甚至低于寻找一个现成工具。这种“氛围编程”正在改变软件的形态,使得软件创作变得像写作一样轻松和普遍,未来也将深刻影响程序员的职业定义。
LLM的GUI革命
当前与LLM聊天,类似于1980年代在控制台敲命令行。文本是计算机和LLM的原生语言,却并非人类偏爱的信息消费方式。人们更喜欢视觉化、空间化的信息,这正是传统计算中GUI被发明的原因。同理,LLM也需要自己的图形用户界面。
Google的Nano Banana正是这一方向的早期探索。它不仅是生成图像,更重要的是将文本生成、图像生成和世界知识三者交织在模型权重中,让LLM能用图表、动画、交互式应用等可视化方式与人沟通,而不仅仅是吐出文字。这预示着LLM交互将迎来一场深刻的GUI革命。