这两天刷到两条帖子,看得我后背发凉。
一条说:很多大模型中转站的商业模式,可能根本不是靠卖token赚钱,而是靠卖你的数据。道理很简单,你跟AI聊天,内容得先发到中转站,再由它转发给模型官方接口,所以你敲进去的每一个字,都先在别人的服务器上明文过一遍。微博
另一条更早几天:一个30人的创业团队用第三方中转站跑Agent,模型返回的内容里被人塞了恶意指令,本地Agent照着执行,把D盘文件删了个干干净净,整套开发环境直接报废。知乎
这两件事指向同一个问题:你图便宜用的中转站,很可能就是你的数据裸奔最彻底的地方。偏偏最近API一波接一波涨价、缩水,大批人正在往中转站和本地部署两边跑。所以今天把这事说透:便宜还能不能占,哪些活该搬回自己电脑跑。
一、中转站为什么能卖到一折?看完这笔账再决定敢不敢用
先说清楚便宜是怎么来的。海外安全团队Vectoral的工程师Matt Lenhard上个月发了一份中转站市场的调查报告,把这条灰色产业链拆得很细:
官方定价每百万token 15美元的模型,在中转站普遍卖一折到两折(他监控的近50家中转站,折扣中位数在80%到90% off),最夸张的一家直接标出官方原价97.8% off。论坛里有运营者晒过账本:一份标价425元的包月套餐,买家实际刷掉了约3333美元、折合2.4万元人民币的官方API额度——花1美元,用掉近8美元的算力。知乎
这价差不是渠道优惠,是因为密钥几乎没有正规采购成本。报告里列的常见手法:批量注册新号薅免费试用额度、用盗刷卡和一次性虚拟卡充值再恶意拒付、把企业没做鉴权的客服机器人和测试接口逆向出来当免费"血包"。
整个链条分工严密:最上层是提供虚拟信用卡的卡商和批量注册的号商;中间是账号池,聚合成百上千个账号统一管理、被封自动切换;下游才是中转站本体——几乎都架在one-api或new-api这套开源网关上。说句公道话,one-api本身是个正经的企业级多模型网关,很多公司拿它在内网管自家密钥,只是到了中转站手里,后台渠道里塞的全是来路不明的密钥。知乎

所以你要明白:一折买到的是"赃物算力",账号随时会被上游封掉,服务随时可能跑路。而比跑路更实际的代价是——你的数据本来就要从它的服务器过一遍。
二、比泄露更狠的三层风险
很多人对中转站的风险认知停留在"数据可能被看"。实际上有三层,一层比一层狠。
第一层,明文可见。你的提示词、代码、业务材料,对中转站运营方就是明文。知乎开头那条"卖数据"的帖子这两天被转了很多次,需要说明:这目前还是社区推测,没看到实锤案例。但数据经过第三方服务器、留存策略完全不受你控制,这一点是确定的,泄露风险主要就发生在存储和留存环节,而不是传输路上。

第二层,响应可以被动手脚。这是删D盘那个案例的机制:中转站在中间,模型返回的内容理论上可以被篡改或注入,你没法验证是不是模型原话。如果只是聊天,顶多被坑;一旦你接的是能执行命令、读写文件的本地Agent,被注入的输出就会在你机器上直接跑起来。删文件、偷凭证都是轻的。知乎Agent越能干,这个口子越致命。
第三层,偷偷换模型。你付的是旗舰的钱,中转站把你的请求悄悄转给更便宜的弱模型,输出降智你还很难察觉。知乎行业跟踪的说法是,监管已经在收紧——生成式AI的管理办法、专项行动都点了中转站的乱象,靠低价和冒充撑着的劣质中转站正在被清出去。微博换句话说,这条灰色通道本身就在变窄,把长期工作流押在上面,不划算。
三、那为什么说现在可以把活搬回家了
因为Qwen3.8-27B把"本地模型够不够聪明"这块短板,补上了大半。
发布不到一周的热度不展开说了,只说和你决策有关的几个点(跑分是官方自测,惯例先打对折听):
270亿参数的稠密模型,4bit量化后文件约17GB,一张4090甚至3090就能完整装下;16G显存也有Q3量化版本可跑,门槛比上一代低得多
第三方榜单Artificial Analysis的Agentic Index给了51分、排第7,第一次有本地能跑的模型挤进这个agent能力榜的第一梯队,压过了DeepSeek V4 Pro和GPT-5.6 Luna
原生262K上下文。它64层里只有16层用全注意力,其余换成线性注意力,KV缓存只有同尺寸传统模型的约四分之一——所以长上下文在消费级硬件上不会立刻爆显存
Ollama、vLLM、SGLang全是发布当天支持,接Claude Code、Cline这类编程Agent的教程已经满天飞

丑话也说在前面:它比云端旗舰还是慢,也还是笨一点。社区实测的速度锚点大概是:M4 Max跑4bit约23 tok/s,5090开MTP能到90-120 tok/s;聊天、写代码、跑常规任务够了,复杂长推理还是云端稳。知乎另外默认思考档位有过度思考的毛病,一张骑自行车的鹈鹕SVG能琢磨21分钟、烧掉两万多推理token,记得把思考强度调到medium或low。
结论不是"全部搬回家",而是该回家的回家,该留云端的留云端。
四、一张路由表:哪些活回家,哪些留云端
判断只用两个问题:这份数据泄露了我扛不扛得住?模型的输出会不会在我机器上直接执行?
三类活,搬回本地跑:
输入含隐私的活。聊天记录、邮件、账本、合同、病历、公司内部文档的整理和总结。这些数据本身就构成了"绝不能出内网"的理由,27B的262K上下文也吃得下大体量材料。
接了本地执行权限的Agent。能跑命令、动文件、读凭证的Agent,输出链路必须可信。中转站的响应注入风险对这类用法是致命的,而本地模型没有中间人。
高频重复的体力活。翻译、清洗、格式转换、批量摘要、初稿打底。这类活token消耗巨大、对智商要求不高,正是本地包月零成本最划算的部分。

三类活,留在云端没问题:
收口和决策。注意,喂给云端的应该是本地整理、脱敏过的半成品——社区已经有人跑通这套"本地挖矿、云端收口"的分工:敏感原料不出门,云端只接触你允许漏出去的那一小部分,就算泄了也不心疼。微博
复杂长推理和前沿能力。本地模型暂时够不着的硬骨头,该花钱花钱。
低频尝鲜。偶尔用一下新模型,不值得为此搭环境,官方渠道或正规大平台直接调。
再补一个识别中转站降智的土办法:固定一组带版本知识的提示词,定期拿官方免费额度的输出对一遍,质量突然塌了就是被换模型了。
五、真准备动手的,三个避坑提醒
别碰极端量化。社区这几天最一致的共识就是Q1、Q2量化掉智严重,评论区随手一翻就是"q1 真的绷不住",Q2"勉强干点体力活,思维无法闭环"。27B请从Q4起步,显存够直接上8bit,智商损失最小。哔哩哔哩
先用手里的设备试,别先下单。有4090/3090、有大内存Mac的先跑起来,用两周真实工作流验证需求是真的,再考虑添硬件。硬件焦虑是被卖出来的,瓶颈往往不是显卡。
代码不出门的团队,这是目前最值得评估的方案。本地接Claude Code这类工具没有封号问题,没有额度焦虑,对合规敏感的小团队,账是算得过来的。知乎

总结一下:中转站把token的价格打下来了,但给你的数据加了一层你看不见的风险。以前没得选,现在本地模型第一次跨过了"能用"的门槛——把见不得光的活搬回家,把收口的活留给云端,便宜和安全就都能占一点。
接下来值得盯着的信号:监管清退劣质中转站的节奏,以及27B第一周实测里被吐槽的token消耗偏高问题会不会有优化版出来。有新情况再聊。