OpenAI新推出的智能体开发框架,首次系统性解决AI在复杂、长周期任务中易失焦、难复现、不安全等核心痛点。它不是概念炒作,而是提供可落地的工程化路径,让AI从对话工具转向可信数字同事。
智能速览
技能(Skills)是标准化、可版本化、带反例描述的操作手册,支持按需加载模板与代码
Shell是OpenAI托管的安全执行环境,支持本地调试与云端稳定运行,实现代码执行与文件闭环
压缩(Compaction)机制动态提炼对话历史,保留关键目标与决策,丢弃冗余过程,保障数小时级任务不偏航
安全设计采用双层白名单+Domain Secrets密钥注入,网络访问默认关闭,杜绝凭证泄露风险
三种工作模式递进演进:模式A(探索验证)→模式B(技能固化)→模式C(SOP数字化)
Glean实测显示:技能+Shell+压缩组合将销售评估准确率从73%提升至85%,响应时间缩短18%
精华内容
当AI不再依赖即兴发挥的提示词,而是调用结构化技能、在隔离环境中执行、并持续保有任务主线时,真正的知识工作自动化才真正开始。
技能:从提示词到可调用程序
技能并非高级提示词,而是封装了指令、代码片段、报告模板和版本控制的标准化功能包。实测表明,Glean在引入技能初期调用成功率反而下降20%,根源在于技能描述模糊导致模型选择困难。
解决方案是采用“路由逻辑式描述”:明确写出触发条件、输出格式、适用边界及典型反例。例如‘生成简报’技能描述中强制加入‘若用户仅要求总结要点,请勿调用本技能’。
更关键的是,技能包内大体积内容(如PDF模板、库依赖)仅在调用时动态加载,上下文占用降低67%,推理成本下降41%。这使百级技能库部署成为可能。
Shell:安全可控的执行工作台
Shell提供两种运行模式:开发者可在本地环境直连企业内网快速迭代,验证成熟后一键部署至OpenAI托管云端,保障数小时任务不中断。
其核心价值在于闭环能力——支持pip安装库、运行Python脚本、抓取网页、写入文件。所有产出物统一落盘至/mnt/data目录,形成清晰的数据契约:AI写入,模型可读取,开发者可提取。
Glean实测显示,启用Shell后,数据清洗+图表生成全流程耗时从平均23分钟压缩至6分18秒,且结果一致性达100%,彻底消除人工复核需求。
压缩:让AI记住最初的目标
传统长对话中,模型上下文窗口被中间思考、工具输出、闲聊信息迅速填满,任务目标常在第8–12轮对话后丢失。压缩机制并非简单截断,而是实时滚动摘要:保留初始目标、关键决策点、最终交付物定义,剔除执行细节与临时推理链。
压力测试显示,在持续4.2小时、含17次工具调用、总token超21万的客户分析任务中,启用压缩的智能体全程未偏离主目标;未启用版本在第3.1小时后开始重复询问原始需求,准确率骤降39%。
文章强调:压缩应设为所有长程任务的默认配置,而非故障后补救手段。
安全:纵深防御的三层实践
网络访问被设为默认禁用状态,开启需经双重白名单授权:组织级白名单由管理员维护,仅允许3–5个高信任域名;每次请求再指定子集级白名单,范围必须严格小于前者。
密钥管理采用Domain Secrets机制:代码中仅出现占位符(如$GITHUB_API_KEY),真实密钥在请求发起瞬间由安全保险库注入,模型全程不可见。
Glean上线该方案后,API调用误发事件归零,内部审计确认无凭证硬编码、日志泄露或内存残留风险。
模式演进:从实验到SOP数字化
模式A(Shell原生执行)用于快速验证可行性,例如单次销售数据清洗;模式B将成功流程封装为技能,实现结果可复现,Glean报告生成稳定性从62%跃升至99.4%。
模式C则实现质变:将顶尖销售在Salesforce中的操作直觉转化为可调用技能。该技能覆盖线索评估、竞品比对、话术推荐三阶段,使全团队评估准确率从73%提升至85%,单任务平均耗时减少18.3%。
这已超出效率优化范畴——它把隐性经验固化为可扩展、可审计、可进化的数字资产,使组织能力不再依赖个体留存。
这套框架标志着AI工程范式的迁移:从提示词的艺术转向结构化系统的构建。技能、Shell与压缩不是孤立组件,而是彼此咬合的齿轮,共同驱动AI完成真实世界中的长周期知识工作。当每个标准流程都能变成一个可调用、可审计、可进化的技能,组织的知识沉淀方式、人才协作形态乃至业务响应速度,都将被重新定义。下一个问题是:哪些流程,最值得优先技能化?