这周对"想自己搞模型"的人来说,信息量有点大。
8月17日零点,DeepSeek 新 API 价格正式生效,第一次引入峰谷计价:旗舰 V4-Pro 高峰时段输出从 6 元涨到 27 元/百万 tokens,缓存命中输入从 0.025 元涨到 0.3 元,涨幅 1100%;空闲时段能打对折。知乎知乎知乎上相关讨论动辄几万、几十万阅读,最高赞的情绪很一致:"价格屠夫"收刀了,账单得重算了。知乎

几乎同一时间,阿里在 8 月 14 日开源了 Qwen3.8-27B:Apache 2.0 协议、27B 稠密、带多模态,Q4 量化后磁盘占用只有 17GB 左右,一张 24GB 显存的消费级显卡就能跑。知乎两天内 HuggingFace 下载量破百万,直接登顶开源榜,有评测给出它 SWE-bench Pro 得分 61.7,超过了 Claude Opus 4.6 Max 的 53.4。知乎同期的通用大模型综合榜单里,Qwen3.8-Max 也以综合分 67.54 进入了前六——开源下载量和闭源榜单,两条线这周一起动了。知乎

再加一条不那么起眼但很关键的:以量化闻名的 Unsloth 在 8 月中旬发布了原生桌面客户端,macOS、Linux、Windows 三端齐发,把"微调"这件事做成了零代码——扔进去 PDF、CSV、JSON 就能自动生成训练数据,官方宣称 24GB 显存就够跑 LoRA 微调。知乎
三件事叠在一起,指向同一个问题:调 API 变贵了,开源基模变强了,微调门槛变低了——那现在花钱微调一个自己的模型,到底值不值?
小红书上一个今年 4 月的帖子这几天又被翻出来讨论,作者说:"每当我辛辛苦苦花几个月去训一个模型准备上线,却发现官方又发布了一个性能更强大的基模,足够涵盖我所需要的场景,导致我这几个月花的时间和资源都白费了。"这帖拿了 400 多赞、近 500 收藏,评论区的分歧很大。小红书这个问题没有标准答案,但可以把账算清楚。下面三笔账,看完你大概知道自己该不该动手。
第一笔账:先搞清楚微调能改什么、不能改什么
很多人对微调的期待是错的,这是白花钱的第一大原因。
先说一个反直觉的新研究。Cohere Labs 今年 8 月发了一篇论文,标题很直白:《Are You Sure You’re Sure?》。他们把 Qwen2.5-7B、Llama-3.1-8B、Mistral-7B 三个模型的"基座版"和"指令微调版"拉出来对比测试,发现指令微调之后,模型表达自信度暴涨——Llama 的口头自信从 49.2% 飙到 90.4%——但准确率纹丝不动,ARC-Easy 上还是 82.2%。Qwen2.5-7B 在 MMLU 上的"选择熵"从 0.430 降到 0.131,意思是从"还会犹豫几个选项"变成"几乎只看到一个选项",但准确率 71.8% 变 71.7%,还微降了。三款模型、三类题目、九组对比,趋势一致:微调让模型更敢说话,但没说得更准。知乎(注:以上为知乎科技博主对该论文的转述,具体数值以论文原文为准。)

这和我们社区里的经验共识是一致的:知乎上"RAG 能不能替代微调减少幻觉"这个问题下,高赞回答的判断是——想靠微调消除事实性幻觉基本是南辕北辙,微调不是"知识灌库"。
所以先把分工划清楚:
微调擅长改的:输出格式和结构、说话风格、指令遵循习惯、工具调用的稳定性、特定任务的固定行为模式。
微调不擅长改的:模型不知道的知识(应该用 RAG/检索解决)、事实准确性、基础智力水平。
如果你的需求是"让它知道我们公司产品的最新参数"“回答时引用内部文档”,那是检索的事,别花微调的钱。如果你的需求是"输出必须严格是某种 JSON 格式"“客服话术必须符合某个调性”“工具调用别老断”,微调才是对症的。
知乎上那篇 45 万阅读的"微调缺少高质量数据怎么办"也印证了这个分工:高赞思路是先问"模型的失败是否真的需要参数更新来解决",缺知识走检索,固化行为才走 SFT。知乎
第二笔账:微调到底要花多少钱
如果确认需求对症,再算钱的账。2026 年的好消息是:微调的硬件门槛已经降到消费级了。
先看显存的经验公式(来自知乎多篇选型文章的汇总,具体以实测为准):
推理:FP16 下约 2 字节/参数,7B 模型约 14GB;INT4 量化后 7B 只要 3.5~4GB。
全参数训练:混合精度下约 6~10GB 显存/每 1B 参数——所以 7B 全参训练要 40GB+,那是 A100 级别的事,个人不用想。知乎
LoRA 微调:只更新一小部分"补丁"参数,显存需求比全参低一个数量级。7B~8B 模型做 LoRA,24GB 消费级显卡够用;QLoRA(4-bit 量化)还能再压,16GB 卡也有人跑通。
再看出手方式,个人基本就三条路:
路线一:租卡。 目前国内平台一张 RTX 4090(24GB)的行情大概在 1.2~1.5 元/小时(有平台青春版挂出 1.24 元/小时起的价)。知乎用 LLaMA-Factory 或 Unsloth 对 7B~8B 模型跑一轮 LoRA,数据量一两千条的话,通常 1~3 小时跑完——单次训练成本也就几块钱。算上试错、调参、失败的轮次,准备 30~50 元预算,够你把一个想法从 0 验证到出效果。注意一个隐藏成本:关机不等于零扣费,数据盘、镜像存储通常还在计费,用完记得清理。知乎
路线二:用自己的卡。 手里有 4090 或者 24GB 级别显卡的,电费之外几乎零成本。这次 Qwen3.8-27B 开源后,社区实测 Q4 量化版在 24GB 卡上就能跑,甚至有 AMD RX 7900 XTX 和核显平台的跑通案例——意味着"本地部署 + 微调小模型"的硬件下限还在往下走。知乎
路线三:白嫖。 Kaggle Notebooks 每周送 30 小时 GPU(双 T4 32GB 或 P100),不用绑信用卡,跑 QLoRA 实验完全够,适合纯验证阶段。知乎
再说 Unsloth 桌面端为什么值得单独提一句:它把微调工具链从"工程师的手艺"变成了"普通人的按钮"。数据集不用自己攒,PDF、CSV、DOCX 直接扔进去,内置的 Data Recipes(底层是 NVIDIA NeMo 的 Data Designer)能自动转成训练样本;训练全程零代码,有 loss、显存实时监控面板;训完直接导出 GGUF/Ollama/vLLM 能用的格式。官方宣称比原生实现快 2 倍、省 70% 显存,支持 LoRA、QLoRA、DoRA、全参、DPO/GRPO 全套。知乎Mac 用户也能训(MLX 后端),这在同类工具里不多见。

但要提醒一句:工具免费,数据不免费。真正贵的从来不是算力,是高质量数据。那篇 45 万阅读的知乎回答给出的方法论值得抄下来:先冻结一批评测集,再生产训练数据;让最懂业务的人做少量 Golden 样本定义标准;围绕模型的失败类型定向合成数据,而不是把一句话换十种说法泛化改写。知乎没有这一步,花再多卡钱也是把垃圾数据训进模型里。
第三笔账:你最贵的成本,可能是"白训"
回到开头那个小红书帖子的问题:基模迭代跟火箭一样快,微调会不会几个月后归零?小红书这个风险是真实存在的,而且 Qwen3.8-27B 就是活例子——假如你上半年花了几周微调一个 7B 模型做代码助手,现在免费开源的 27B 在代码能力上可能已经整体碾压你的微调成果。微博上有投资人评论说,现在"小版本更新不必重新训练全新的基础模型,后训练能力越来越强",翻译过来就是:基模厂商自己就把大量垂直场景的活儿干了。微博所以第三笔账是折旧账,判断标准有这么几条:
你的微调收益,是来自"基模不会做的事"还是"基模暂时没做好的事"? 前者(比如你司私有的工具调用协议、极特殊的输出格式、离线保密要求)折旧慢,值得投入;后者(比如"代码写得更好一点"“通用问答更准一点”)很容易被下一代基模直接抹平,别重投入。
LoRA 权重是小资产,别当大工程做。 LoRA 适配器通常只有几百 MB,训练一次几块钱。正确的姿势是"轻量微调 + 快速重训":基模升级了,把同一份数据在新基模上重跑一遍 LoRA,成本可控。真正要沉淀的资产是数据集和评测集,不是那版权重。
先问有没有更便宜的替代方案。 决策顺序建议是:提示词工程 → RAG/检索 → 换更强的开源基模 → 微调。每一步验证不行了再走下一步。很多人反着来,上来就租卡训练,最后发现一个 prompt 就能解决。
谁该动手,谁该观望
把三笔账合起来,给个可以直接对号入座的结论:
建议现在就微调的:有固定格式/合规话术要求的企业场景、工具调用链路总断的 Agent 开发者、数据不能出本地的隐私场景、以及想系统学会这套技能的人(这是大模型岗位面试的高频考点,B站上相关教程这周更新了一堆,侧面说明需求真实)。哔哩哔哩
建议先观望的:需求本质是"查内部资料"的(去做 RAG)、调用量不大的(DeepSeek 空闲时段半价,低频用 API 仍是最便宜的)、以及期待"微调让模型变聪明"的(论文已经证明这条路不通)。
接下来值得盯的三个信号:一是 Qwen3.8 之后 9~10 月还有没有新一轮开源基模发布(基模每换代一次,你的微调决策就该重审一次);二是 DeepSeek 峰谷计价下各平台的实际账单表现(已有开发者在晒涨价前后对比);三是 Unsloth 桌面端对 Qwen3.8-27B 的微调适配情况——24GB 卡 + 免费工具 + 最强开源基模,这套组合如果跑顺,"个人微调"的性价比会到一个历史高点。
最后一句话总结:2026 年,微调这件事,工具门槛是历史最低,但"值不值得做"的判断门槛是历史最高。钱要花在基模替代不了的地方,数据比显卡值钱,权重会折旧,评测集不会。