大厂都在限制员工使用最贵模型了,我们怎么优化模型搭配
花旗银行干了件有意思的事:把 Claude Opus 4.7 和 GPT-5.5 的访问权限全关了。

原因不复杂,太贵了。
不只是花旗。
Adobe 取消了 Claude 无限使用权。
Atlassian 的 AI 月支出从 500 万涨到 1500 万美元后紧急踩刹车。
亚马逊悄悄下线了 AI 使用排行榜。
同一周,Meta 被曝计划对外出售算力。
扎克伯格在内部会上承认:过去四个月,AI 智能体的发展并没有按预期加速。
巨头都在踩刹车
404 Media 从六家企业拿到了泄露的内部资料,拼出的画面相当一致:企业 AI 支出在失控。
花旗的做法最典型。
全公司共用一个 Token 池,开发人员重度依赖 AI 写代码,把共享额度吃得差不多了,轻度使用者只能被迫降级到更弱的模型。
邮件里明确说: 快速问答用 GPT-5.3-Codex ,代码审查用 Claude Sonnet 4.6,只有架构推理才允许用更高阶模型。
旗舰模型成了奢侈品,非必要不调用。

Atlassian 的数据更扎眼。2025年8月,AI 相关月支出 500 万美元,到 2026 年5月飙到 1500 万。
员工反映,额度两三天就耗尽,尤其是调用最新 Claude 模型的时候。
还有个讽刺的细节:
Atlassian 发现大量高额 Token 消耗不是因为工程师批量写代码,而是员工用 AI 把 PDF 转成 PPT 。
企业AI的真相: AI 够好用,好用到用不起。
个人用户从一开始就走了一条不同的路
说真的,看到这些新闻的时候,我的第一反应不是惊讶,而是庆幸。
我在 NAS 上部署了 Hermes 当 AI 助手,跑了快半年了。
每天记账、管理知识库、自动推选题、定时备份数据,一天 24 小时在线。你猜我每月的 Token 成本是多少?
大概 30 块钱 。
方法不复杂,三条路叠加:
用便宜的模型干大部分活,本地跑免费模型兜底,贵的模型只在需要的时候用。

第一,选对模型,别上来就拉满。
日常对话、简单任务用 MiniMax 或者 DeepSeek 的 flash 模型就够了,Token 价格不到 Claude Opus 的十分之一。
我们不需要每个问题都让最强模型来回答,就像我们不需要每封信都用特快专递寄。

第二,本地模型免费兜底。
我在绿联 DX4600 这台 NAS 上跑了 Ollama 和 TEI ,部署了 bge-small-zh-v 1.5、paddleocr-noavx 这类向量、OCR 小模型。
它们不强,但处理简单向量化任务、跑 Hindsight 、知识库入库时简单提取图片内文字信息绰绰有余。
零成本。 跑在本地,不走 API ,不花一分钱。

还有一些简单任务:
整理格式、提取关键词、做数据分类、压缩上下文。 这些活儿不需要 Opus 级别的推理能力,找个免费模型或者非常低价的模型处理就行。
第三,贵的模型按需调用,别当日常工具。
复杂推理、长文写作、代码审查,这些确实需要好模型。但把 GPT-5.5 拿来翻译一句话,就像开卡车去买菜,不是不行,就是浪费。
Hermes 可以配置模型路由,简单任务自动走便宜模型,复杂的才上旗舰。这就是花旗想做的事,但薅资本家羊毛人的天性,他们做不到,我们自己就很容易实现了。

AI 降温不等于普通人该停
扎克伯格说 AI 智能体发展不及预期,Meta 开始卖算力,这些被很多人解读为 AI 泡沫信号。
我的看法不太一样。
巨头减速,这不是 AI 不行了,而是因为他们的打法太粗放了。
所有业务线全力推进,每个员工都在用旗舰模型干杂活,成本当然失控。
这跟当年云计算刚出来时一模一样。企业先是无脑上云,什么都往云上搬,然后发现账单吓人,才开始做云成本优化。 现在AI走到了同一个拐点。

对普通人来说,这个拐点反而意味着机会。
我们从一开始就因为成本受限,反而被迫养成了更聪明的使用习惯。
用便宜的模型干大部分活,本地模型免费兜底,贵的模型按需调用。这不是降级,是更合理的资源配置。
花旗的AI邮件最后说了一句大实话:
我们需要所有人按需审慎选择模型,保障全公司员工都能公平使用AI资源。
把"全公司"换成"全家",这就是我们已经在做的事。
