单价只有旗舰1/7、账单却先涨40%:Gemini 3.8 Flash首发价只挂到元旦,想换用先把这3件事看清

源自182位全网作者

05:46

9月2日深夜,谷歌把 Gemini 3.8 Flash 丢了出来——六周之内第三款 Flash(7月底 3.6、8月中 3.7、9月初 3.8),同一天 Meta 还顺手发了 Muse Spark 1.3,两家"闪电小模型"对台,科技圈首页刷了一整天。36氪

但如果你只看两种标题,会被彻底带偏:一边是"单价只有旗舰 1/7,跑分暴击 Opus 5",另一边是两万播放的 B 站实测视频《矮子里拔将军,居然还真能用?》,还有"干活挺勤快,就是没开窍"。哔哩哔哩今日头条 对一个每天拿模型干活、月底看账单的人来说,真正的问题只有一个:这次发布把价格战从"单价层"打进了"账单层",而首发价只挂到跨年前夜。

下面三件事,按顺序看清。

一、单价没涨,账单先涨了40%

先把牌面上的数字摆齐。3.8 Flash 输入 $0.75、输出 $3.75(每百万 token),和上一代一分不差,大约是 Claude Opus 5($5/$25)的七分之一。

问题出在谷歌官方博客自己承认的那句话上:3.8 会"works harder"——任务变难时,模型多走推理步数、反复调工具、自己验证结果。能力是这么涨上来的,token 也是这么烧掉的。第三方评测机构 Artificial Analysis 的实测:单次任务消耗 token 从 3.7 代的约 3.7 万涨到 4.8 万,单任务实际成本从 $0.40 涨到 $0.58,贵了 40%;首字延迟平均 13.3 秒,同类模型中位数只有 2.99 秒。知乎 再看两个参照系:

  • 对比自家前代 3.7:同价,但每单贵 40%;

  • 对比旗舰:第三方 Datacurve 验证长程编程任务通过率与 Opus 5 打平,3.8 Flash 每任务 $2.36,Opus 5 要 $11.84,差 5 倍知乎

所以这笔账的结论是:比旗舰便宜得真实,比自己上一代悄悄变贵。单价表正在失去"直接等于成本"的意义——想省钱,得用自己的任务跑一轮,别信任何人的单价宣传。头条那篇评论的标题其实最准确:“谷歌把价格战打进了 token 消耗层”。今日头条

单价只有旗舰1/7、账单却先涨40%:Gemini 3.8 Flash首发价只挂到元旦,想换用先把这3件事看清

二、榜单哪门是真的,哪门是"背题"

官方和媒体放了一堆分数,逐门拆开看,它的强弱比宣传里清楚得多:

真强的几门:

  • 长程软件工程 DeepSWE v1.1:73.7%,对比 3.7 代的 65.3%,离 Opus 5 的 74.0% 只差 0.3 个点;

  • 终端操作 Terminal-Bench 2.1:89.4%,全场第一;

  • 长视频理解 LVBench:87.8%,比 Opus 5 高 12 个点;

  • 1M token 上下文 + 指令遵循"刻板"——深度用户的评价:在 Agent 环境里同时开多个子任务"毫无 token 焦虑",调工具极少出 schema 级错误。

露馅的几门:

  • 同一个终端考场换成新题(Terminal-Bench 4.0):19.1%,Opus 5 是 51.8%——旧卷 89、新卷 19,这是社区"背题"质疑的核心证据;

  • 真实电脑操作 OSWorld 2.0:59.0%,落后旗舰 16 个点;

  • 综合知识工作 GDPVal:1545 Elo,Opus 5 是 1824;

  • Artificial Analysis 综合分:59,低于 Opus 5 max 的 63 和 Anthropic 前一天发布的 Fable 5.1 max 的 66。知乎

单价只有旗舰1/7、账单却先涨40%:Gemini 3.8 Flash首发价只挂到元旦,想换用先把这3件事看清

还有一个必须记住的坑:官方演示里那个精美的 3D 城堡,是在谷歌自家 Antigravity 平台里反复迭代、还调用了生图模型拼出来的;媒体用同样的提示词在普通环境复现,得到的是"漏水的火山口"。跑分考的是"模型+工具+迭代"整套系统,不是裸模型单打独斗。知乎

单价只有旗舰1/7、账单却先涨40%:Gemini 3.8 Flash首发价只挂到元旦,想换用先把这3件事看清

一句话定位,也是那篇两万播放实测视频的准确翻译:它是干活的牛马,不是全能顾问。

三、首发价窗口、用不到的 Cyber 版,以及分工清单

价格窗口。知乎几篇拆解文都提到同一个信息:这次是"首发价",挂到 2026 年 12 月 31 日,2027 年 1 月 1 日起输入涨到 $1.50、输出 $7.50——正好翻倍。知乎 一次 20 万输入 + 2 万输出的静态任务,从现在的约 $0.225 变成约 $0.45。这个说法来自整理信源而非谷歌官方中文页面,上车前以自己的账号后台定价页复核为准。就算复核属实也别慌:现在是 9 月初,离"翻倍"还有近四个月,足够你拿真实任务先跑一轮。

用不到的 Cyber 版。同场发布的 3.8 Flash Cyber 主打漏洞发现(CyberGym 86.2%)和自动修补,但不公开、不售卖,只通过 Fairwind 计划定向开放给政府、关键基础设施和软件维护者,普通用户用不到。知乎 看到"安全能力领先,你也能用"的稿子,直接划走。另外,撑牌面的 Pro 版这次压根没影,3.5 Pro 也已经拖了三个月——要顶级推理的还在等。知乎

单价只有旗舰1/7、账单却先涨40%:Gemini 3.8 Flash首发价只挂到元旦,想换用先把这3件事看清

换不换,对号入座:

你现在用 3.8 Flash 干什么

判断

长程编码、批量修 bug、跑测试

值得现在换,五分之一的旗舰成本

多 Agent 并发、大量子任务、长文档/长视频精读

适合,token 便宜到不用心疼

金融、法律类垂直 Agent 工作流

官方口径全场第一,但绝对分不高(法律仅 10%),管住预期

日常问答、聊天式使用

别换,13.3 秒首字延迟会毁掉体验

点鼠标填表式的电脑自动化

别指望,比旗舰差 16 个点

综合咨询、直接要交付物

继续留给旗舰,Elo 差 279 分

两个省钱的实操细节:3.8 Flash 的 thinking level 分 LOW、MEDIUM、HIGH 三档、默认是 MEDIUM,简单任务手动降 LOW 能明显压 token。知乎 迁移前按四个字段记一周账——任务成功率、总 token、重试次数、墙钟时间——"账单层"的价格战,只能用账单层的数据验证。

最后说下学生党:小红书这两天"Gemini 学生优惠又可以白嫖了?"的体验帖又热了一轮。小红书 那是订阅端的羊毛,跟这次 API 首发价是两回事,别混着算。

接下来盯什么

  • 1 月 1 日定价页是否真的按翻倍执行,以及翻倍后各家"闪电模型"跟不跟价;

  • 3.5/3.8 Pro 什么时候放出来——Pro 才是这轮版本号的天花板;

  • “works harder” 式计价会不会被 OpenAI、Anthropic 跟进:如果是,往后所有模型的单价宣传都要打对折着看;

  • Terminal-Bench 4.0 这类新题库下一轮更新后,3.8 Flash 还顶不顶得住——"背题"质疑目前只有一份证据。

工具越出越快、三周一代,恰恰说明厂商在抢走量市场:这对天天干活的人是好事,但前提是别看错价签。首发价四个月,牛马随便用,顾问还得请。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章