作为OpenAI一系列核心模型(从GPT-3.5、GPT-4到未来的GPT-5)背后的核心贡献者之一,翁家翌的工作为我们提供了一个观察OpenAI模型技术跃迁的内部视角。他在2022年加入OpenAI,其主要贡献可以概括为三个关键领域:强化学习、后训练(post-training)以及基础设施(infra)。这些领域共同构成了近年来驱动大型语言模型能力实现飞跃的核心动力。
模型的技术跃迁并不仅仅依赖于预训练阶段数据量和参数量的堆砌,更关键的步骤发生在“后训练”阶段。后训练是指在模型完成基础的、大规模的文本学习之后,通过一系列精细化的调整来优化其行为,使其更符合人类的期望。翁家翌所专注的强化学习,尤其是基于人类反馈的强化学习(RLHF),正是后训练阶段的核心技术。RLHF通过引入人类的偏好和判断作为奖励信号,引导模型学习如何生成更安全、更有用、更符合指令的回答。2022年前后,将RLHF成功应用到大规模语言模型上,是实现ChatGPT般流畅、智能交互体验的关键突破之一。

然而,在工业级别上实现如此复杂的训练过程,面临着巨大的挑战。这就引出了翁家翌的另一个核心贡献领域——基础设施。这里的基础设施并非单指硬件,更多是指支撑大规模模型进行强化学习和后训练的复杂软件系统与平台。要让一个拥有数千亿参数的模型高效、稳定地进行RLHF训练,需要极其强大的系统工程能力来处理海量数据流、协调计算资源并保证训练过程的稳定。可以说,一个强大且可扩展的基础设施,是模型从“理论上可行”迈向“实践中强大”的必要前提。
随着模型能力不断增强,另一个重要议题也浮出水面:AI的“黑箱”问题。即我们虽然能看到模型输出了什么,却不完全理解其内部的计算过程和决策逻辑。为了应对这一挑战,OpenAI等机构正在积极探索“机制可解释性”(Mechanistic Interpretability),尝试系统性地揭示AI的内部运作方式。

这项研究旨在从模型内部的计算结构出发,理解其行为的形成机制,这对于提升AI系统的安全性与透明度至关重要。OpenAI在这一方向上探索了多种路径。一种思路是通过训练“稀疏模型”来实现。与每个神经元都与下一层数千个神经元相连的稠密模型不同,稀疏模型被强制要求大部分权重为零,每个神经元只连接少数其他神经元。这种简化的结构使得研究人员可以更容易地分离和理解负责特定任务的“电路”,例如模型是如何记住并正确配对引号的。
另一种方法则更有趣,即用一个更强大的模型(如GPT-4)来解释一个较小模型(如GPT-2)的神经元功能。通过分析哪些文本片段能高频激活特定神经元,再让GPT-4用自然语言来描述该神经元可能承担的功能,研究人员得以初步绘制出模型内部的概念地图。
以翁家翌的贡献为线索,我们可以看到OpenAI模型的技术跃迁是一条双线并进的路径。一方面,通过强化学习和后训练等先进技术,不断提升模型的性能和对齐能力,这背后离不开强大基础设施的支撑。另一方面,通过对机制可解释性的前沿探索,努力打开模型的“黑箱”,加深对其工作原理的理解。这两方面相辅相成,共同推动着AI技术朝着更强大、也更安全可靠的方向持续演进。