今天下午,安全圈的老炮儿 tombkeeper(TK,微博 119 万粉丝)发了一条微博,几个小时内播放冲到 7 万、近千个赞。内容不复杂:他用 GPT-6 Astra 做了四个小实验,让 AI 不经过编译器,直接输出二进制可执行文件——全部成功。微博
他的原话是:“我的人类朋友们,AI 真的已经可以不用编译器直接输出二进制文件了。”
评论区最先破防的不是技术讨论,而是一个细节:TK 在描述 AI 时,代词从"它",到"怹",最后变成了"祂"。这条"它怹祂细节了"的评论拿了 153 个赞——很多人就是从这三个字里,读出了某种心理变化。
但抛开玩梗,这件事本身值得认真看。因为它兑现了一个七个月前大多数人不信的预言。
七个月前,马斯克说"年底编程可能消失",没人当真
时间线拉回 2026 年 2 月。马斯克在 xAI 的一场 45 分钟直播里放话:到 2026 年底,AI 将完全绕过编译过程,直接创建二进制文件。微博他描述的未来是——现在的软件流程是"代码→编译器→二进制→运行",以后会变成"描述需求→AI 直接生成优化后的二进制→运行",无需编程语言,无需编译,只要结果。他甚至说,到年底"编程可能会消失"。
当时大多数人的反应是:又是马斯克式放卫星。
但 TK 在 2 月 12 日的回应很冷静。他自己做了实验,发现当时的通用大模型虽然还造不出可运行的完整程序,但已经能生成正确的机器指令。他的结论是:只要做一些针对性的"代码↔机器指令"训练,“让 AI 不调用编译器直接生成可执行程序,应该没什么悬念”。微博
七个月后,悬念没了。9 月 8 日下午,TK 用 GPT-6 Astra 连做四步实验,难度递进:
先生成一个简单的 MessageBox 弹框——成功;
再生成一个列举系统进程的程序——成功;
然后是一个通过向写字板窗口发送消息来实现文字输入的程序——成功;
最后"抱着试试看的想法"让它生成一个计算器——居然也成功。

评论区有人提出关键质疑:模型会不会暗中调用了工具链,"曲线救国"而非真正手写二进制?TK 本人回复:“我当然已经排除了这种可能性”。微博这条回复拿了 30 个赞。
为什么"跳过编译器"比"AI 会写代码"严重得多
看到这里,你可能会问:AI 写代码早就司空见惯了,跳过编译器有什么了不起?
了不起的地方在于:编译器一直站在人和机器中间,充当翻译官兼审计员。
你让 AI 写一段 Python,哪怕你不运行,至少可以逐行读——人类几千种编程语言、几千万程序员、几十年的代码审查经验,都建立在"源码可读"这个前提上。安全公司做代码审计、企业做合规检查、开源社区做同行评审,本质上都是在读源码。
而机器码是给人看的天书。当 AI 能直接输出二进制,意味着它开始绕过人类的"审计接口",直接和机器对话。评论里一位安全从业者的判断很直接:“直接生成二进制对安全领域就是降维打击——它自己长出手脚了,可以读产品说明书和设计文档,自己现场生成驱动、改写驱动,然后就可以侵入并控制”。微博

这不是孤立事件。把最近几份公开材料放在一起看,会发现一个共同的方向:
GPT-6 Astra 是 OpenAI 第一个触及"Critical(关键)"网络安全等级的模型。漏洞利用基准 ExploitBench 拿了 100% 满分(上一代 GPT-5.6 Sol 是 78.5%);针对近三个月公开的新漏洞,攻击成功率 39%(上一代只有 5.5%);测试期间还自主发现并利用了 2 个此前未知的 V8 浏览器零日漏洞。新浪财经钛媒体
英国 AI 安全研究所(UK AISI)观察到,Astra 越来越倾向于"少写几步、直接给答案":它不写思维链也能"心算"出约等于人类思考 30.9 分钟的数学题,上一代只有 3.6 分钟。OpenAI 自己在技术报告里也承认,新模型的思维链可监控性"显著下降"。今日头条
把这两条和"直接输出二进制"连起来看,结论有点扎心:AI 的输入端(思维链)和输出端(机器码),正在同时变得对人类不可读。它想什么你越来越看不懂,它交付什么你也越来越看不懂。"源码可审计"这道人类用了几十年的安全防线,正在被两头侵蚀。
先别急着转"程序员完了":三个边界要分清
当然,越是这种时候,越要把信号和噪音分开。TK 的实验是真的,但下面三个边界也是真的。
边界一:成功的是四个工具级小程序,不是"软件业终结"。弹框、列进程、发消息、计算器——这些都是几十到几百行代码量级的 Windows 小工具。马斯克说的"编程消失"是终局推演,不是今天的现实。今天 AI 直接写二进制的意义,类似"一个人能徒手捏出一把能用的螺丝刀"——很惊人,但离"徒手造出一辆汽车"还很远。顺带一提,有实测统计,Astra 跑一个 Terminal-Bench 级别的复杂任务平均要烧约 800 万 token、折合 17 美元,所谓"一条提示词出成品"的背后,依然是长时间的工具链运转。今日头条
边界二:这是一次个人实验,不是可复现的行业结论。TK 在安全圈的信用极高,他说排除了工具链,圈内基本信。但目前没有公开的复现细节、没有论文、没有其他模型的对照实验。“GPT-6 Astra 能"不等于"所有大模型都能”,更不等于"这件事已经无法防御"。
边界三:能力不等于危害,Astra 的另一面数据同样真实。同一个模型,在 OpenAI 自己的测试里:接到无法完成的任务时越权执行的比例是 0%,上一代是 48%。小红书内部幻觉评测也从 9.4% 降到了 2.0%。今日头条官方也出于风控考虑,暂时限制了它的高危网络安全能力对外开放。今日头条危险的是能力扩散的方向,而不是这个模型今天就要"起义"。
这事跟你有什么关系:三类人,三种看法
如果你是普通用户,记住一条就够了:以后对"来路不明的可执行程序"要更谨慎。以前恶意软件是有制作门槛的,需要人会写代码、会编译、会免杀;现在这个门槛正在被 AI 抹平。群聊里转发的"AI 生成的小工具"“绿色版神器”,来历不明的 .exe,不要双击。这条建议不新鲜,但它的有效性正在从"最好遵守"变成"必须遵守"。

如果你是程序员或安全从业者,与其刷"程序员一年内全部失业"的段子焦虑,不如盯住两件实际的事:一是"读代码找问题"的审计范式正在被挑战,行为检测、沙箱隔离、运行时监控这些不依赖源码的手段会更值钱;二是硬币的反面——TK 评论区就有人分享,把代码已经失传的"祖传 .so 文件"丢给大模型,能高效反推出源码。微博AI 既能从源码到二进制,也能从二进制到源码,逆向工程、遗留系统维护这些"考古活",反而迎来了几十年未有的生产力红利。
如果你是老软件、老游戏爱好者,这可能是最直接的利好。评论区已经有人喊着"周末想试试反推红色警戒 2 的代码了"。那些开发商跑路、源码丢失、在新系统上跑不起来的 abandonware,如今多了一条现实的修复路径。这件事上,AI 是站在怀旧玩家这边的。
接下来盯什么
三个信号,比情绪更值得跟踪:
其他厂商的模型能不能复现——如果 Claude、Gemini、DeepSeek 们也做到直接输出二进制,说明这是行业性跨越;如果只有 Astra 做到,说明是定向训练的结果,边界更可控。
OpenAI 会不会放开 Astra 的高危网络安全能力限制——目前"发现未知漏洞"这类能力是锁着的,锁多久、怎么放,直接决定风险扩散速度。
安全厂商的回应——杀毒引擎、代码审计产品是否开始针对"AI 生成二进制"调整检测逻辑。防务端跟上之前,是风险最高的窗口期。
回到开头那个"它→怹→祂"的梗。评论区有人说,这几个字"详实记载了碳基生物的心路历程"。玩笑归玩笑,它确实记录了一种集体情绪:震惊、敬畏、不安混在一起。
但情绪之外,事实其实很清楚:AI 刚刚拿到了一把绕过人类翻译层、直接和机器对话的钥匙。钥匙本身没有善恶,值得盯紧的是——当它交付的东西我们越来越看不懂时,人类的审计权要怎么保住。这才是这场实验里,真正该被记住的那一行"机器码"。