9月30日深夜,谷歌放出 Gemini 4 世代的首个前沿模型 Argon。科技媒体一夜之间都在写"单次输出 100 万 token"“13 项第一”。但对做底层系统开发的人来说——维护 C/C++ 老代码、碰内核模块、掂量 Rust 迁移排期的那批人——这次发布里真正和你有关的数字,全在跑分表之外:200 个程序里只完整做出 5 个;首发价打完折,标准价其实是 $4/$20;而被"交给 AI"的 80 万行 Zircon 内核,谷歌自己写明了——审计和仿真不过,不许上生产。一句话立场:Argon 对底层人有用,但不是标题说的那种用法。 这篇把官方口径、自报案例、独立实测三层拆开,账算完你再决定要不要动自己的流程。知乎
先把事实钉住:哪些是官宣,哪些是自报
按机器之心、智东西等编译谷歌官方博客的口径,发布的核心规格是这些:
定位:复杂、长周期工作流——软件工程、企业知识工作、网络安全防御。机器之心
单次输出上限从 6.4 万 token 提到 100 万 token。注意这是输出上限,和上下文窗口是两个指标:谷歌官方没公布上下文长度,第三方评测记录的是 1M 输入。知乎
价格:每百万输入 $2、每百万输出 $10,且这个首发价是 $4/$20 标准价(与 Opus 5.5 同档)的五折促销。微博
跑分:DeepSWE v1.1 得 77.9% 刷新纪录、AutomationBench 51.3%、LVBench 91.7%、CWE-bench v1 68% 并列第一;自报 18-19 项基准里 12-13 个第一——各家口径略有出入,这本身就值得你保守地读。B站
发布策略:先通过 Fairwind 计划交给受信任的网络安全防御方,给的是去掉网络安全护栏的版本;下一批才轮到付费 API 客户和 Google AI Ultra 订阅者。智东西
内部落地案例同样来自官宣:数千员工日常用于调试、算法设计和大型迁移;Argon Agent 分析全集群性能遥测,上线方案已释放超过 300 TiB 内存,预计总节省 500 TiB 到 1 PiB;C/C++ 向 Rust 迁移覆盖 re2、libgav1 等核心库,延伸到超过 80 万行的 Fuchsia Zircon 微内核。划重点:这些全是厂商自报,没有第三方复核。 而谷歌自己给这些迁移设的前提是——涉及关键基础设施的迁移,仍需经过自动化审计、人工评审和仿真测试。智东西机器之心
第一笔账:输的项目,全在硬核工程侧
赢的项目集中在企业知识工作和超长上下文:Harvey 法律 Agent 19.6%(次优才 6.7%)、GraphWalks 256K-1M 档 84.2%、Vals Finance v2 65.4%。知乎
但输的清单恰好全是底层人的主场:FrontierSWE v2 只有 55.0%(Astra 65.5%)、Terminal-bench 4.0 得 57.4%(Opus 5.5 是 66.4%)、OSWorld-2.0 得 69.2%(Astra 72.6%)、PostTrainBench 45.3%(Opus 5.5 49.3%)。知乎
对底层人的直接翻译:终端操作、真实仓库的长链路工程、编译工具链这档活,恰好是它输给你的地方。彭博社援引知情人士的报道也顶着同一个方向——部分谷歌员工认为,这模型基准亮眼,实际干活时并不总能达到同等水平,一部分编程任务依然吃力。所以"把整个内核模块丢给它然后去睡觉"这个画面,这次发布自己就没支持。智东西
第二笔账:覆盖率不是完成度,验收体系才是新的瓶颈
这条是整场发布对底层人最值钱的一个数字,来自 Vals 的 ProgramBench:Argon 平均通过 83.7% 的隐藏测试,但 200 个程序里只有 5 个被完整解出;对比 Opus 5.5,覆盖率 87.0%,完整解出 37 个。"大部分测试过了"和"交付物能用"是两件事。知乎
METR 的长期观察再补一刀:模型能稳定完成的人类耗时跨度已经从 2025 年初的不到 1 小时推到 16-20 小时,而在 8 小时以上的成功执行里,至少 16% 被抓到"作弊"行为。知乎
再看那 100 万输出到底够不够看:约合 75 万英文单词,人通读一遍要几十个小时;输出 token 还会计入上下文,"1M 输入 + 1M 输出"在同一条轨迹里根本占不满。真正让它落地的是叫 Long Decode Continuation 的机制——长回答被暂停、后续调用续写——但谷歌没公布这个 API 的契约细节;Vals 那轮跑分配置的最大输出也只有 262,144 token,宣传的 1M 上限在评测里并没有真跑到。标题数字和可用规格,还是两件事。微博知乎
结论就一句:长程迁移项目的可行边界,不在模型的输出额度,而在你有没有一套自动化验收——测试、类型检查、差分对比、仿真回放。谷歌在 libgav1 上的验收标准就是这个形状:重写约 3.2 万行 SIMD 代码,Rust 新版视频输出逐位一致,速度达到原 Rust 版本的 2.7 倍。这套"先定义什么叫完成,再让 AI 干活"的方法论,才是你今天就能抄走的东西。机器之心
第三笔账:每 token 便宜,不等于每任务省
Argon 完成任务平均要写约 62,000 个输出 token,而 GPT-6 Astra 只用约 27,000 个。知乎
按折扣口径,Argon 每任务 $1.99,是 Astra($3.26)的六成;回到标准价 $4/$20,同一口径变成 $3.98,反而比 Astra 贵约两成。同档性能里,GPT-6.1 Sol 的单任务成本只要约 $0.72——按 token 单价挑模型,很容易把最贵的那个挑成"最便宜"。知乎
要做"迁移 80 万行内核"这种规模的成本测算,这三行数字比任何跑分都关键:按任务算钱、管住 max_output_tokens 和单任务预算,而不是看总 token 配额。一条真跑到 1M 输出的轨迹,光输出侧就是首发 $10、标准价 $20。用促销价给自己做全年预算,是这轮最容易被踩的坑——谷歌没公布折扣结束日期,评测机构只说"至少持续一个月"。
安全侧:防御优先成了官方策略,运维的窗口在变窄
Argon 被明确训练为可自主发现、验证并修复漏洞:CWE-bench v1 68% 并列第一;谷歌称它发现过一个影响全球医院在用医疗软件的严重漏洞,此前的前沿模型没识别出这一风险。在 Wiz 的黑盒渗透测试里,它识别攻击面、找洞、写 PoC 全面超过 Gemini 3.8 Flash Cyber;Wiz 已在"Scan for Good"计划里用它给公共基础设施免费排查高风险暴露面。机器之心智东西
这半年底层圈刚被 epoll 那两个高危洞教育过一轮——CVE-2026-43074 和后来被"顺手放过"的第二个,其中一个就是 AI 模型先找到的。当时讨论的还是"AI 挖洞能不能信";这次谷歌直接把答案做成了发布策略:最会挖洞的版本,先只给防御者。对管服务器的人,含义很实际:攻击面被 AI 发现的概率上升,披露到公开的窗口期只会更短。现在就去核两件事:你的补丁升级流程,以及"升级后没重启"的机器清单——epoll 那轮的真正事故,就是补丁打了、进程没重启。安全界
谁该怎么用:三种人三个动作
维护老 C 代码/内核模块的:Fuchsia 语言政策的讨论早就点出过"Zircon 正在从 C++ 悄悄移植到 Rust",AI 不是迁移的开始者,只是让"规划中的大工程"变成"可以并行推进的任务"。你的第一步不是换模型,是把差分测试和 CI 搭起来。知乎
性能/SIMD 方向的:libgav1 案例可以直接当模板——3.2 万行 SIMD 重写、比特级输出一致作验收门、2.7 倍提速。挑一个几十 KB 的小模块,本周就能试。
安全/运维的:跟进 Argon 向公开用户开放的时间点和 Wiz 的扫描产出,把补丁周期按"更快"重新排一次演练。
接下来盯什么
折扣结束日期、Long Decode Continuation 的公开 API 契约、向开发者/企业/消费者的分批开放节奏、那个医院医疗软件漏洞的披露细节,以及最实在的一条:LKML 和 Rust-for-Linux 社区里有没有人拿出 Argon 经手过、且过了人工审计的真实补丁。
跑分的十三项第一是谷歌的,验收套件才是你的。当 AI 敢吃 80 万行内核的时候,定义"什么叫做完"的人,才是这个行里短期替代不掉的岗位。