DeepSeek涨价350%,但这不是急着微调的理由:3个问题决定这笔训练预算该不该花

源自259位全网作者

10:32

8 月中旬,两条价格新闻,把"该不该微调"这个老话题又顶到了台前。

8 月 17 日起,DeepSeek 对 V4 全系实行峰谷分时计费,旗舰 V4-Pro 高峰时段输出价从 6 元/百万 tokens 涨到 27 元,涨幅 350%。知乎有开发者把开放平台的真实账单拉出来,9 天分时实测加 78 天回溯,结论很直白:同样的用法,新价格下要多花 4 倍的钱。知乎一周后的 8 月 26 日,阿里发布并开源 Qwen3.8-Flash——125B 总参数、每次只激活 6B,千问 AI 平台给出的价格是输入 0.8 元/百万 tokens,输出 2.7 元,缓存命中只要 0.1 元。知乎

一边涨价,一边把价格打到地板。"微调还是调 API"的争论双方,都觉得自己收到了天启。

DeepSeek涨价350%,但这不是急着微调的理由:3个问题决定这笔训练预算该不该花

但翻完这两周知乎、小红书、B站上的讨论,我想先说个结论:这波价格波动,没有改变"该不该微调"的答案,只改变了算账的方式。

两拨人吵得很凶,其实答的不是同一道题

现在社区里吵得挺热闹。B站一条《大模型微调就是骗局》的视频有 4.3 万播放,148 条评论两派互掐;小红书上一篇讲"Prompt 已经写得很详细了,但模型输出还是不够稳定,格式不统一,业务规则也记不牢"的帖子,收藏过了五千,帖子里给的答案是微调。哔哩哔哩小红书更卷的是,8 月 14 日 Qwen3.8-27B 刚开源两天,就有开发者完成了首个公开的全参微调,自称"全网第一个"。小红书

两边看着都有真实案例,但仔细看前提,他们答的根本不是同一道题。

“骗局"派针对的,是把微调当知识注入——喂一堆公司文档、业务资料,指望模型"学会”;“该微调"派说的,是拿微调改行为——固定输出格式、稳住语气、把分类边界咬死。知乎近期一个高赞回答把这层边界概括得很准:RAG 解决的是"没喂到”,微调解决的是"喂到了还是不对劲"。知乎

问题一:你要改的是知识,还是行为?

那个高赞回答里讲了个踩坑故事。他们的内部知识助手接了几千篇 wiki、SOP,项目启动时总有人嚷着"不微调回答就飘"。后来把 badcase 拆开看,80% 的错误根本不是模型能力问题——是检索拿错了东西,是拿到了三年前的过期文档,是 chunk 切得太碎。知乎把重排、时间衰减、引用约束补上,命中率立刻上去,成本只多了一点检索和重排。

DeepSeek涨价350%,但这不是急着微调的理由:3个问题决定这笔训练预算该不该花

所以第一个问题:你的模型"不行",是没告诉它,还是告诉了它也不照做?

知识本身每周都在变的——报价单、制度、产品配置、排班表——别犹豫,直接 RAG。你不可能每更新一次知识库就重训一遍。

想改的是行为——永远按固定 JSON 输出、学会你家客服的话术、把"账号异常"和"权限申请"两类工单分得清清楚楚——微调才进入候选。

问题二:你的"不稳定",是微调能治的那种吗?

方向对了,微调起效还有前提:RAG 已经做干净了,Prompt 已经磨到头了,而且你手里有评测集。那个高赞回答给的方法很实在——先做 200 到 500 条真实样本的评测集,别拿 demo 问题自我感动;跑通之后看错误是不是集中在同一类任务上,是,再谈微调。知乎

对症之后,微调的收益是很具体的:

  • 有个内部工单分类器,拿几万条清洗过的历史工单做轻量微调,F1 从 0.78 干到 0.91,人工复核量直接砍掉一半。知乎

  • 知乎一个 LoRA 微调全记录专栏,39 分钟训练,医疗场景 BLEU 提升 59.4%,代价是通用能力大约 3% 的损失。知乎

  • 还有一个实战案例把 Gemma 调成情绪判断专家,准确率从 62% 拉到 91%。知乎

注意这三个案例的共同点:任务边界清晰、有评测集、目标单一。"一次训练,包治百病"是对微调最常见的幻想。

这里也要泼盆冷水。Qwen3.8-27B 那个"全网首个"全参微调,帖主自己的结论是:在一些已经刷饱和的数据集上,新底座 qwen3.8 和旧的 qwen3.6 差别不大——底座变强,不等于你的任务自动变好。小红书你的任务能提升多少,只有你的评测集说了算,榜单不算。

问题三:2026 年 8 月这笔账,你算得过来吗?

对习惯算性价比的朋友,这才是最要紧的问题。微调买的不是"更聪明的 AI",是"固定的行为",而固定的代价有三个:

第一,权重绑定当前底座。开源底座迭代快得惊人——Qwen 半年内连出 3.5、3.6、3.8 三个版本,DeepSeek 也已经到了 V4。底座一换,行为想平移就得重训,这条成本躲不掉。

第二,数据是隐形大头。知乎有实践者复盘,微调项目里数据清洗通常要占掉整个周期的一半到七成——宁可要 2 万条干净样本,也不要 5 万条脏数据。知乎模型的上限是数据定的,不是训练脚本定的。

第三,API 涨价确实是新问题,但它是"调度能解决"的问题。DeepSeek 周六周日已经全天按低谷价计费,高峰只集中在工作日 9-12 点和 14-18 点,批处理任务挪到低谷就能躲开。知乎涨价的是一家供应商,你可以换供应商;而微调出来的模型,把你绑死在一条技术路线上。

真正"值得微调"的信号很窄:任务规则长期稳定、调用量巨大、或者格式稳定性有硬要求——票据分类、单据抽取、固定格式输出、用定制小模型给高频业务降推理成本。这几条一条都不沾,就别碰。

真到了该微调的时候,也请从小处开始

现在微调的门槛已经很低,低到个人就能跑通全流程:小红书有人用 qwen3-4b 做 LoRA 微调,30 个类别的分类任务,验收标准是每个类别精确率 85% 以上;B站甚至有人拍了《0.8 元+个人显卡,微调属于自己的大模型》。小红书哔哩哔哩LoRA、QLoRA 加一个 4B 级小模型,一张消费级显卡就能完成一轮验证。

DeepSeek涨价350%,但这不是急着微调的理由:3个问题决定这笔训练预算该不该花

正确的顺序是:先用一次小成本验证"微调确实能治你的病",验证通过了,再谈要不要上规模。

最后给一张自检清单

花训练预算之前,问自己五个问题:

  1. 我要补的是知识还是行为?知识 → 先做 RAG,别想微调。

  2. 这些知识每周都在变吗?是 → RAG,别想微调。

  3. 我有 200-500 条真实评测样本吗?没有 → 先做评测集,做完答案自己会浮出来。

  4. 错误是不是集中在"同一类任务总犯同一种错"?错得零散 → 先修检索和 Prompt。

  5. 任务规则一两年内稳定、调用量够大吗?两条都不沾 → 微调性价比极低。

还有三个值得持续盯的信号:高峰涨价会不会蔓延到更多供应商、开源模型会不会继续把调用价往下打;新底座上 LoRA 权重的迁移方案成熟得有多快——每次新模型发布多久有人出适配,基本决定了你手里权重的迁移成本;以及你所在领域的评测集好不好找,它决定了每次重训的边际成本。

一句话收尾:调 API 像点外卖,RAG 像自带食材请人加工,微调像请私厨。8 月外卖价格上蹿下跳,影响的是前两者的账;要不要请私厨,看的从来是你自己的嘴刁不刁,不是外卖贵不贵。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章