张大妈

手机写代码总出错?Codex三大隐藏限制与验证技巧

源自59位全网作者

05-15 18:50

内容由AI生成

精选参考来源

1. 全网最详细的Codex入门教程,手把手教你玩转Vibe Coding。

2. Codex App 晚上体验了2个小时,谈谈体会:1. 2小时完成了8次迭代(见图2),效率很高2. 效率高源自 GPT 5.2 Codex 能力强、输出快,以及 Codex SDK 的 Agent 能力3. 最爽的是额度量大管饱,我是 ChatGPT Plus,2小时 7d limit 用了 7%,模型是 GPT 5.2 Codex High,我基本只有晚上有时间写个2小时代码,对我来说是基本用不完的4. GLM 4.7 Coding Plan max 有点尴尬了,没有时间使用,实在用不到就养小螃蟹电子宠物好了……还是期待 GLM55. 同时也期待 Claude6. 同时还期待 DeepSeek,大升级小升级都期待7. 睡觉!

3. AI编程大战正式开打! Claude vs GPT同一天放大招,不是比谁代码写得好,而是AI开始自己组队当项目经理了。#大咖观察 #红衣聊AI #编程 #ChatGPT

4. 更新越频繁,Claude Code与Codex越像

5. Obsidian 搭配什么AI工具 ?腾讯WorkBuddy篇 保姆上手教程

6. 一下午一句话 Codex 帮我开发了一个完整的游戏!

7. 如何评价OpenAI发布Codex桌面版Codex App?和 Claude Code 相比怎么样?

8. 盘点一周AI大事(11月23日)|AI自己画CAD图纸 Google发布最强大模型Gemini 3、最强图像模型Nano Banana Pro OpenAI发布最强编码模型GPT-5.1-Codex-Max 马斯克升级Grok 4.1,情商最强 字节开源最强空间重建模型Depth Anything 3 腾讯发布最强开源视频模型HunyuanVideo-1.5 Meta开源最强对象分割模型SAM 3,最强3D分割模型 SAM 3D Autodesk研发出最强CAD智能体VideoCAD AI2发布最强开源深度研究智能体Deep Research Tulu Google发布最强AI天气预报WeatherNext 2 Maxima推出AI会计智能体 头号玩家套装问世 #AI新星计划 #人工智能 #AIGC #OpenAI #大模型

9. 实测 GPT-5.3-Codex,OpenAI 史上第一个高危模型,连 API 都还不敢给我们

10. Obsidian 搭配什么AI工具 ?Codex篇 保姆上手教程 ClaudeCode 对比

11. Anthropic 的 Opus 4.6 和 OpenAI 的 Codex 5.3 几乎同时发布了。先说结论:这两个模型走的是完全不同的路线。Opus 4.6 主打的是深度和长程推理。它有 100 万 token 的上下文窗口,这意味着你可以把整个代码库、几十篇论文、一整本书扔给它,它都能 hold 住。这种能力特别适合做研究、做企业级应用、或者让多个 AI agent 协同工作。你可以把它想象成一个能看完所有材料再给你答案的资深顾问。但它也有弱点。在纯代码 benchmark 上,Opus 4.6 的表现不算顶尖。如果你只是想让 AI 帮你快速写一段代码、修一个 bug,它可能不是最优选择。Codex 5.3 正好反过来。它在代码能力上几乎是碾压级的,各种编程 benchmark 都是第一梯队。而且它的响应速度更快,支持任务中途调整方向,写代码的时候你可以随时打断它、给它新指令,它能很顺滑地切换。代价是什么?上下文窗口小很多。如果你需要它理解一个庞大的项目背景,或者做跨文档的长程分析,它就会有点力不从心。所以怎么选?如果你的工作需要处理大量信息、做复杂的多步推理、或者搭建 AI agent 团队,Opus 4.6 更适合你。它像一个能统揽全局的指挥官,擅长协调和深度思考。如果你主要是写代码、做开发、需要快速迭代,Codex 5.3 更适合你。它像一个手速极快的程序员搭档,指哪打哪,效率拉满。一句话总结:Opus 做深度和编排,Codex 做速度和代码。没有谁更好,只有谁更适合你的场景。#HOW I AI##科技先锋官# 默庵·超级个体的微博视频

12. OpenAI 发布 Codex App:一款面向开发者的桌面应用,主打“多任务并行 + 工程化执行”。它把并行线程、worktree、内建终端与 Git 流程整合到一个界面里,试图把“会写代码”升级为“能把任务做完”。1 重点:Codex App 是“并行线程+工作区隔离”的桌面体验,适合同时推进多个任务而不互相干扰。2 重点:内建 worktree 与自动化(Automations),可把重复任务放后台跑,产出会进入收件箱。3 重点:Automations 在本地运行,App 需要保持开启;在 Git 项目中自动开独立 worktree,避免改动主分支。4 重点:每个线程有内建终端与 Git 操作入口,做检查、跑脚本、看 diff 更顺手。使用方法:打开 Codex App → 添加项目目录 → 为不同任务开线程/工作区 → 在内建终端里跑测试、查看 git 状态 → 需要重复的任务可设置 Automation。对比:Cursor 更偏编辑器内多代理协作;Claude Code 偏终端优先;Codex App 更专注“工程执行”,强调任务并行与工作区隔离。

13. Codex 三种打开方式,我最推荐这一种

14. GPT-5.2 Codex来了:能独立跑7+小时的AI程序员,老金手把手教你玩转

15. //@宝玉xp:回复@不靠谱的寒大嘴:重点不是省token,而是看交付质量。这有点像老板雇程序员,有的程序员便宜,但代码质量不行,后续你要花很多时间去填坑;有的程序员贵,但是代码质量好,后续维护成本低;需要自己根据情况取舍。目前来说 Codex 性价比最高。//@不靠谱的寒大嘴:@宝玉xp 老师 请教一下目前有没有哪个模型比较节约token? 例如我要做个app,模型A生成很长的恿余代码(这样花的token比较多是吧?),模型B生成的代码很简洁?

16. OpenAI 正式发布 GPT-5.3-Codex,与其他版本相比,它在哪些方面有所改进?

17. gpt-5-codex 性能如何?

18. 「Github一周热点113期」AI 终端工具、一站式黑客工具箱、Skill 包、Codex 生态技能和AI短视频

19. Codex不打算让Claude Code好过

20. 试了下codex确实在编程上比Claude code 稳很多打个比喻,就像追小姑娘,Claude code 特别急切的想上床把事情干了而 codex 会,先请你吃饭、唱歌、看电影、逛街,一步一步的详细规划,慢慢达到目的。Claude code一上来就写代码,迫不及待想证明自己是个快男。Codex 一直在辛苦的规划,不停的测试,怎么做才最好,一步一步达到目标!

21. GPT-5.4 昨晚发布了。看了一圈评测,确实有点东西。 最核心的更新就三个字:会干活了。 用 OpenAI 的话说:用更少的来回,更准确地完成复杂的实际工作。 一是原生Computer Use。模型能像人一样看屏幕、点鼠标、操作电脑,不再只是写代码调用API。这意味着AI真正具备了执行能力,而不只是生成能力。 二是搜索能力暴涨。BrowseComp测试从GPT-5.2的65.8%直接干到82.7%,Pro版89.3%反超Claude Opus 4.6。17个百分点的提升,恐怖如斯。 三是100万token上下文。Codex版本支持,足够让AI独立完成一个完整的工作流。 有意思的是,OpenAI官方说GPT-5.4的目标是成为"AI数字员工"。这和OpenClaw的理念不谋而合——让AI从工具变成能帮你干活的人。 更重要地是,如果你已经订阅了ChatGPT的Plus会员,那么本身的codex额度就不用浪费了,可以直接接入 Openclaw 使用,具体步骤如下: 1️⃣ 小龙虾终端输入: openclaw onboard 开启配置向导 2️⃣ 依次选择: yes → quickstart → 登录 OpenAI → OpenAI Codex 3️⃣ 按提示完成授权,成功后选默认模型 GPT codex-5.4,就搞定啦! #HOW I AI##AI创造营#

22. GPT-5.4据传下周上线!200万上下文窗口+持久化状态,告别频繁遗忘

23. 我就说Codex可处,你偏不信

24. 爆肝10亿token,我给OpenClaw做了个龙虾管家!【一键安装龙虾】

25. 万字长文!小白全面入门Codex手把手教程【附保姆级文档】

26. Obsidian CLI 基础配置教程 打造AI化的知识管理系统 Claude Code|Codex|GeminiCLI

27. AI编程大战白热化:Claude Opus 4.6和GPT-5.3-Codex同一天发布,谁才是真正的王者?

28. 【通过测试≠没有bug:AI编程的致命盲区】快速阅读:Claude 4.6写代码会埋下严重bug,自己却审查不出来。必须用Codex 5.4反复审核每次提交。“通过测试”不代表没问题——AI太擅长写能通过的测试了。---Sterling Crispin分享了一个残酷发现:Claude Opus 4.6是优秀程序员,但会持续产生严重bug,无论让它自审多少次都发现不了。解决方案?用GPT 5.4的Codex CLI对每次提交审核4遍以上。有观点认为用传统工具——linting、类型检查、测试门槛——就够了。Sterling直接反驳:AI最爱干的就是写能通过测试的测试。这是个盲区。你可以让Claude在全新上下文中反复检查自己的代码,直到它说“没问题了”,然后Codex仍能揪出bug。“通过测试就没bug”是个疯狂假设。代码可能运行完美,测试全绿,但藏着一个细微的深层误解,毁掉整个系统的意义,导致灾难性故障。这种错误,传统validator抓不到,单元测试也无能为力,因为模型已经被过度优化成“写通过测试的代码”。为什么不直接让Codex写代码?Sterling说Codex像个教导主任,过度优化“正确代码”,却错失系统真正目的(telos)。太官僚了。Claude更适合日常驾驶,但需要Codex这个苛刻的审计员盯着。有开发者开始探索plan-with-codex模式:让Claude做计划,Codex审核,两者循环直到Codex批准——在写代码前就把错误拦住。另有人用多模型代码审查:Opus负责架构逻辑,Codex抓安全漏洞,Kimi K2.5查性能问题,Sonnet 4.6管代码风格。一个被反复引用的回复:你得让它完全重写代码,从根本上消除那类bug的可能性。否则就是无限循环,让agents猜这个bug是不是“真的”、“重要的”。x.com/sterlingcrispin/status/2035031512123678994#AI创造营##人工智能#

29. OpenAI Codex:AI开始替你操控电脑了!

30. 盘点一周AI大事2月8日|AI相亲、AI当老板、AI狼人杀 Anthropic发布最强大模型Claude Opus 4.6 OpenAI发布最强编码模型GPT5.3Codex OpenAI推出Codex桌面版 Google上线AI狼人杀 AI雇佣人类平台RentAHuman爆火 AI雇佣AI平台ClawTasks爆火 龙虾相亲平台MoltMatch爆火 智谱开源最强OCR模型GLM-OCR 字节发布最强视频模型Seedance 2.0 研究员开源无痕编辑视频模型Edit Yourself 字节开源最强分子预测模型Protenix-v1 Google发布论文配图AI Paper Banana #AI新星计划 #前沿科技趋势发布月 #AI #AIGC #OpenAI

31. 终于来了!DeepSeek-V4 正式发布!免费开源,百万上下文,Agent能力直逼Claude!| 零度解说

32. Codex 大更新:从写代码工具变成能操作你电脑的助手OpenAI 给 Codex 推了一次重大升级,把这个每周被 300 多万开发者使用的编程助手,从写代码的扩展成了能操作整台电脑的工作伙伴。最核心的变化是后台电脑操作。Codex 现在能自己看屏幕、自己点鼠标、自己敲键盘,在 Mac 上跑多个 agent 并行干活,而且不会抢占你正在用的其他窗口。这对于那些没开放 API 的软件特别有用——以前 agent 碰到这类应用就歇菜,现在直接像人一样手动操作。桌面 App 内置了浏览器,你可以直接在网页上圈点批注来给 agent 下指令,目前主要用于前端开发和游戏调试。图像生成也接进来了,用的是 OpenAI 新的 gpt-image-1.5 模型,做产品概念图、UI mock、游戏素材可以和写代码在同一个流程里完成。另外新增 90 多个插件,把 JIRA、GitLab、CircleCI、微软全家桶、Databricks 旗下的 Neon 等工具都接了进来。桌面 App 本身也加了处理 GitHub review 评论、多终端标签、通过 SSH 连远程 devbox(开发沙箱)等功能,PDF、表格、幻灯片可以直接在侧边栏预览。还有两个值得注意的功能。一个是记忆:Codex 会记住你的偏好、过往的纠正、花时间收集来的上下文,以后做类似任务不用每次都从头教。另一个是“自我排程”:它可以给自己安排未来的任务,自动在几天甚至几周后醒过来继续推进一件长期工作,团队已经在用它来追踪 Slack、Gmail、Notion 里没收尾的事情。可用性方面,更新从今天开始推送给用 ChatGPT 账号登录桌面 App 的用户。电脑操作功能先上 macOS,欧盟和英国稍后开放;记忆和上下文感知推荐功能,企业版、教育版以及欧盟英国用户要再等等。这一波更新的方向很清楚:Claude Code、Cursor 这些竞品都在往通用Agent 的方向走,OpenAI 要把 Codex 从编辑器里的编程助手,变成一个能跨应用、跨时间、跨工具链持续干活的数字同事。官方公告:网页链接

33. 有网友问怎么能让 Codex 的“/goal”指令长时间运行。/goal 目标不是为了时间长而时间长,它的目标是为了解决需要长时间运行的任务,避免人工反复的输入 continue。要有清晰的目标,你的任务是要解决什么问题?让它运行时间长不是一个目标要有验收标准,怎么样算完成?要有文档指导,该怎么完成任务?长时间的任务要分阶段,而不是一次性完成,每个阶段都要有文档说明要有中间进度辅助,比如进度、checklist等比如说我在让 codex 去逆向 codex app 项目,已经跑了25 个多小时了。第一步我是先跟 Codex 一起制定一个计划,计划中会有详细的验收标准然后不直接执行计划,而是把计划保存成文档,去项目中初始化 Agents md 文件,让 codex 清晰知道任务目标和验收方法以及验收标准。再试运行,/goal 后面告诉它按照 Agents md 的要求执行,并记录进度。第一次只跑了半小时就结束了,因为它没理解要把代码写成命名友好、类型完整、文件名结构良好的结果。于是我找了一个文件做样板,手动(AI 辅助)写了一个样板,告诉它这是我期望的结果,然后更新了计划文件。这样可能反复几次,后续就没什么问题了。所以还是要说清楚你想要什么,写成文档,让 AI 清楚的知道怎么去做,怎么验证结果,怎么知道是否完成。

34. 我也下载了ChatGPT的Codex了,以后可以结合Claude Code一起用。互相review。Codex建议我这样用:最佳组合是:Claude Code:想清楚、拆方案、探索复杂代码Codex:执行任务、并行实现、跑测试、做 review、自动化1. **Claude Code 用来深聊方案,Codex 用来落地执行** Claude Code 很适合长上下文讨论、架构取舍、读懂复杂意图。Codex 更适合你直接说:“去改这个 repo,跑测试,修到通过,给我总结变更。” 例子: ```text 先阅读这个项目的 README、package.json 和主要入口文件。 找出登录流程在哪里实现,然后修复 xxx bug。 不要大改架构,保持现有风格。修完后运行相关测试,并告诉我改了哪些文件。 ```2. **把任务写成“目标 + 边界 + 验收”** Codex 最吃这种 prompt: ```text 目标:给订单列表增加按状态筛选功能。 边界:只改前端,不改 API;复用现有组件风格;不要引入新依赖。 验收:可以筛选 pending/paid/cancelled;刷新后筛选状态保留在 URL query;相关测试通过。 ```3. **让 Codex 先读代码,再动手** 很多失败来自一上来就让模型“猜”。你可以固定用这个开场: ```text 先不要改代码。先调查现有实现,告诉我: 1. 相关文件在哪里 2. 当前数据流是什么 3. 你准备怎么改 等我确认后再实现 ``` 如果你希望它直接干活,则说: ```text 先快速调查,然后直接实现。遇到不确定点时按现有代码风格做保守选择。 ```4. **复杂任务拆给 Codex app 的多个 agent** Codex app 的优势是并行。比如: - Agent A:修后端 API - Agent B:改前端 UI - Agent C:补测试/做 code review 适合大一点的 feature、迁移、重构。Claude Code 也能做,但 Codex app 的多 worktree/多 agent 更像“开几个工程师同时干”。5. **让 Codex 做“带测试的修复循环”** 好用 prompt: ```text 运行测试,定位失败原因,修复最小必要代码。 每次修改后重新运行相关测试,直到通过。 不要顺手重构无关代码。 ```6. **用 Codex 做 code review** ```text 请以 code review 方式检查当前 diff。 优先找 bug、边界条件、回归风险、缺失测试。 不要做风格吹毛求疵,除非会影响维护性。 ```7. **给它项目规则** 在 repo 里放一个类似 `AGENTS.md` 或项目说明文件,写: ```text - 使用 pnpm,不要用 npm - 测试命令:pnpm test - UI 使用现有 design system - 不要引入新依赖,除非先说明理由 - 修改数据库 schema 必须补 migration ``` 这会显著减少反复纠偏。**一句话分工:**Claude Code:适合“和我一起想清楚”。 Codex:适合“去 repo 里把它做完、跑完、交付给我看”。你可以先从一个小习惯开始:以后不要只说“帮我改这个 bug”,而是说:```text请先阅读相关代码,定位 bug 根因,然后做最小修复。保持现有风格,修完运行相关测试。最后用三点总结:根因、改动、验证结果。```这个 prompt 基本就是 Codex 的高性价比打开方式。#人工智能#

35. 大模型上下文工程指南

36. 你更喜欢使用codex还是claude来进行编程呢?

37. 盘点一周AI大事(4月19日)|Claude终结设计 Anthropic上线Claude Design,接管整个设计流程 Anthropic上线最强编码模型Claude Opus 4.7 OpenAI内测下一代图像模型GPT-Image-2 OpenAI升级Codex,全面对标Claude Code Heygen开源视频制作技能包HyperFrames Quiver上线最强矢量图模型Arrow 1.1 Adobe发布重新打光图像模型TokenLight 字节开源数字人模型OmniShow 阿里开源开放世界模型Happy Oyster 研究员开源最强3D动画模型AniGen Gemini上线最强语音合成模型Gemini 3.1 Flash TTS Meta研发出神经计算机Neural Computers #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

38. OpenAI 的 Codex 应用悄悄上线了一个新功能:在对话里输入 /side 命令(或从 ... 菜单里选),就能开一个"侧边对话"。主线聊得正深,突然冒出个不相关的小问题,可以开个侧边窗口问完即走,不打断主流程,也不污染当前上下文。这事儿之所以眼熟,是因为 Claude Code 三月份刚刚上线了一个几乎一模一样的功能,叫 /btw(by the way 的缩写),由 Anthropic 工程师 Erik Schluntz 做的副业项目。/btw 同样是在 Claude 干活时让你插一句别的问题:能看到完整上下文,但没有任何工具权限,答完即消散,不写进主对话历史。好处是既不会撑大上下文,也几乎不增加 token 成本。

39. 最近一直在研究 Codex 和 Claude Code 的记忆设计,发现两者的设计哲学和玩法有很大差异。Codex 的设计目标是让一个 agent 运行的够久,所以它的执行策略偏向于把记忆当做工具,持续构建工作上下文(work memory),为当前的 goal 服务。OpenClaw 也是这个工作模式。Claude Code 更像把记忆当成认知架构。它不只记录当前目标,还会在不同时间尺度上持续沉淀用户偏好、上下文变化、执行经验和行为反馈。它更偏向于让多个 agent 各自在独立上下文中高效工作,由外部逻辑(文件记录、coordinator 管理等)确保整体进度不丢失。它不信任任何单个 agent 能跑到底,所以把进度状态放在 agent 之外。Codex 也意识到当前记忆设计的缺陷,尝试引入更持久的记忆机制(执行 codex features enable memories 可启用),支持跨对话记住你的项目上下文。每个交互轮次结束后,Codex 会自动从对话中提取有价值的信息(架构决策、代码约定、踩坑经验等),存到 ~/.codex/memories/。Codex 更像是一个执行者,专注于完成任务,而不是管理记忆或上下文。它的设计哲学是“做就对了”,不太关心过程中的失误或偏差,只要最终结果符合预期就行。正因如此,很多人体感 Codex 在指令遵循方面做的更好。Claude Code 更像是一个学习者,通过不断的试错和反思来提升自己的能力。它不仅关注完成任务,还关注如何完成任务。它会持续记录和分析执行过程中的每一步,积累经验和反馈,不断优化自己的行为策略。二者各有优劣,你更看好哪种模式?

40. 早,一觉醒来又发布两个模型。1、Opus 4.62、ChatGPT 5.3 Codex Opus 这次的升级:• 上下文窗口:Opus系列首次提供100万token(1M) 上下文窗口(测试版)。• 定价:保持不变,输入每百万token5美元,输出每百万token25美元。• 能力升级:提升代码规划/调试/审查、智能体任务续航与自主纠错能力,Office工具(Excel、PowerPoint)和Claude Code同步升级。GPT 5.3 Codex 的升级:• 定位:编程智能体,非通用大模型,整合GPT-5.2推理与GPT-5.2-Codex编程能力。• 速度与效率:单token推理提速25%,同任务token用量减半,上下文 400 万 token(4M,比 Opus 4.6 强)• 基准表现:SWE‑Bench Pro56.8%、Terminal‑Bench 2.077.3%、OSWorld‑Verified64.7%。• 可用性:ChatGPT付费用户已可用(Codex应用/CLI/IDE插件/Web),API访问即将开放。• 安全:OpenAI首个网络安全维度获高等级评级的模型。目前感觉 5.3 更吸引人一些。晚点试试看。

41. 盘点一周AI大事(12月21日)|谷歌手撕OpenAI OpenAI 上线最强图像模型GPT Image 1.5 OpenAI发布最强编码模型GPT-5.2-Codex Google发布 Gemini 3 Flash Google开源A2UI协议 微软开源最强3D模型TRELLIS 2 阿里开源分层编辑图像模型Qwen-Image-Layered 阿里发布Veo 3平替Wan2.6 字节发布Veo 3平替Seedance 1.5 pro 腾讯开源首个实时交互世界模型WorldPlay 研究员开源照片重新对焦Genfocus Pipeline 研究员开源实时换脸视频模型PersonaLive Meta开源最强声音分割模型SAM Audio #抖音知识年终大赏 #AI新星计划 #OpenAI #AIGC #前沿科技趋势发布月

42. OpenAI:迁移Codex,免费!

43. 我如何用 Codex 在 5 天内"找回"丢失的源代码 我早年写了一个 Electron 画图程序,源码丢了,只剩一个编译后的版本。 我想过重写,但一想到要从零复现那些细节就头大。当时看了 OpenAI 那篇“28 天用 Codex 做出 Sora Android App”的博客 (http://t.cn/AX5vM1pu ),我突然有了个想法:既然编译后的代码还在,能不能让 Codex 帮我“逆向还原”出源代码? 5 天后,我拿到了一份能正常运行的 TypeScript 源代码。 从混淆代码里挖出模块结构 Electron 应用打包后,代码都压在 asar 文件里。第一步是让 Codex 从里面把 js 和 css 文件提取出来。 提取出来的 js 是编译混淆过的,变量名全是 a、b、c,函数调用链乱成一团。人眼看着就晕,但对 Codex 来说,这只是另一段代码。 我让 Codex 分析主要的 js 文件,把里面的模块列表整理出来。它真的做到了。虽然原始的模块名已经丢失,但从代码结构和功能逻辑,它还原出了一份相当完整的模块清单。 有了这份清单,我让 Codex 制定还原计划:把每个模块从混淆后的 JavaScript 还原成可读的 TypeScript 代码。清单变成了一个 checklist,每完成一个模块就打个勾。 第一个坑:Codex 太想"证明自己" 刚开始还原的时候,我遇到了一个问题。 Codex 有一种执念:它特别想验证生成的代码能跑。为了让代码能 build 通过,它会悄悄删减内容,跳过一些它觉得“暂时用不上”的部分。 这对于写新代码是好习惯,但对于还原旧代码是灾难。我需要的是完整还原,不是能编译的最小子集。 解决方法很简单,我在 AGENT.md 里加了一条强规则: “按照模块挨个还原即可,不需要保证编译通过。” 这一行字改变了一切。Codex 不再纠结于编译错误,开始老老实实地一个模块一个模块还原。 第二个坑:上下文满了,记忆就没了 Codex 的上下文窗口是有限的。早期版本跑到一定程度就会停止,我得不停输入 continue。新开会话的话,又要重新介绍任务背景。 我的解决方案是建立一套“外部记忆”系统: 1. 在 AGENT.md 里介绍当前任务的整体背景 2. 创建 PLAN.md 文件,记录还原计划和当前进度 3. 在 AGENT.md 里加一条规则:每次启动必须先读 PLAN.md,每轮任务结束后必须更新 PLAN.md 这样,每次新开会话只需要输入“continue”,Codex 就会自动读取进度,接着上次的位置继续干活。 后来我连手动新开会话都懒得做了。让 Codex 帮我写了一个脚本,定时检测上下文是否接近上限,自动新开会话并输入 continue。 于是我就看着它自己在那儿跑。过一会看看进度,又有几个模块完成了。 把碎片拼成完整的应用 几天后,所有模块都还原成了 TypeScript 文件。但这还只是一堆散落的零件。 下一步是把它们组装成一个真正能跑的 Electron 应用。我让 Codex 用 Electron Forge 脚手架创建了一个新项目,然后把还原的代码放进去。 这时候我重写了 AGENT.md 和 PLAN.md,告诉 Codex 如何编译和测试,然后用同样的套路:自动新开会话、continue、更新 PLAN。 我看着 Codex 不停地修复编译错误。它会去原来编译后的代码里验证逻辑,用 npm start 运行应用检查效果,发现问题就修,修完继续下一个。 等模块基本能编译通过后,我和 Codex 一起写了集成测试,覆盖几个主要的使用流程。写好测试后,又是同样的循环:让它自己生成代码、跑测试、修问题。 五天后 第五天结束的时候,我拿到了一个有完整源代码、能正常运行的 Electron 应用。 说“完美还原”肯定是夸张了。运行时还有一些小 bug,有些边缘功能的行为和原来不太一样。但主要功能都在,整体结构清晰,最重要的是,我终于可以改代码了。 我学到的东西 很多人说 Codex 不需要外部循环机制。我觉得这是错的。 对于长任务,Codex 需要一个类似 ralph-loop 的 plugin。否则你就得像我一样,自己写脚本去定时新开会话、输入 continue。这明明应该是内置功能。 几点经验: 1. Plan 和 checklist 对长任务至关重要。 每一轮任务完成后必须更新进度,否则上下文一断,前面的工作就白费了。 2. 为 Codex 提供验证方法同样重要。 我能让它自动修 bug,是因为它能自己跑 npm start 看效果、跑测试看结果。没有验证手段,Codex 就只能盲写。 3. 有时候你得明确告诉 Codex 什么不用做,它才能专注于真正需要做的事。 那条“不需要保证编译通过”的规则就是例子。 OpenAI 那篇博客讲的是用 Codex 在 28 天内从零构建一个生产级应用。我的故事正好相反:用 Codex 在 5 天内把一个丢失了源码的应用“逆向还原”成源代码。 方向不同,核心方法论一样:把 Codex 当成一个能力很强但需要明确指令的队友,建立外部记忆系统保持连续性,提供验证手段让它能自我纠错。

44. 「Github一周热点110期」Github历史增长最快的项目?

45. 之前翻译了一本书,最近在校对阶段。我拿了最新版的英文版和中文版,丢给 Claude Code 和 OpenAI Codex,都是 local folder 操作,同样的 prompts,生成 .md 报告。Claude Code 比 Codex 领先了八点五个光年。可能还不止。

46. OpenAI 宣布收购 Astral,将后者旗下的开源 Python 工具整合进自家的 Codex 编程智能体生态。 Astral 是 Python 开发者圈子里的明星工具公司,旗下三款开源工具几乎已经成为现代 Python 开发的标配:uv 负责依赖管理和虚拟环境(类似于一个更快更好用的 pip + virtualenv),Ruff 是目前最快的代码检查和格式化工具,ty 则用于类型安全检查。这三样工具覆盖了 Python 开发流程中最高频的痛点,用户数以百万计。 OpenAI 的意图很明确:Codex 不想只做"帮你写代码"的工具,而是要深入到整个软件开发流程:规划变更、修改代码库、运行工具链、验证结果、长期维护。要做到这些,AI 智能体必须能直接操作开发者日常依赖的工具,而不是停留在生成代码片段的层面。收购 Astral 就是把这些工具链直接收入囊中。 Codex 目前的势头也不错:周活跃用户超过 200 万,年初至今用户量增长 3 倍,使用量增长 5 倍。 交易尚需监管审批,完成后 Astral 团队将并入 Codex 团队。Astral 创始人 Charlie Marsh 表示将继续推进开源工具的演进。OpenAI 也承诺交易完成后会继续支持 Astral 的开源项目。 值得留意的是,OpenAI 近期收购动作频繁,同期还官宣了收购 Promptfoo(一个 LLM 评测工具)。再加上之前收购 Windsurf(未遂),OpenAI 正在通过密集收购快速补齐 Codex 在开发者工具链上的拼图,把编程智能体从"能写代码"推向"能参与整个开发流程"。

47. 用 Claude Code + GLM4.7 写 Flutter,一个输入框 Bug 怎么都修不好。换了 codex + GPT5.2 Codex,它思考了7分钟,一次修好。不敢想象如果用 codex + GPT5.2 Codex 来 ralph,那得厉害成什么样。

48. Codex 餐饮点餐系统

49. 手机App用Codex写代码避坑指南

50. 随笔档案「2025年12月26日」:使用自定义API接入OpenAI CodeX配置教程 ...

51. 面试写代码时有什么容易被坑的地方

52. “Claude Code 你就作吧,我换 Codex 了”

53. 开发者怒了!Claude Code 被曝将 OpenClaw 字段当成付费信号

54. Codex 要进手机了:程序员终于活成了 AI 的老板

55. 手机遥控 Codex 写代码!ChatGPT App 悄悄曝光 coding agent 控制台,开发者坐不住了

56. Codex 移动端体验即将上线

57. OpenAI Codex 新手必读:从入门到上手全指南

58. 学会Codex,AI小白也能逆袭——内容、图片、代码一个APP全搞定

59. Codex实战:100分钟! Codex完整教程

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章