Qwen3.8-27B 上周开源之后,微调圈又热闹起来了。
这几天信息流里全是 Qwen3.8-27B 在消费级显卡上的各种实测,Unsloth 照例 T+1 就放出了不同精度的 GGUF 量化版本。知乎量化能压到多狠?最激进的 1-bit 版本能把 27B 参数压到 6.2GB、保留 77% 的准确率,8GB 内存的机器就能跑起来。知乎不过那是推理部署的事,真要微调,显存账完全是另一套算法。量化之后精度到底掉多少,看这张 Qwen3.8-27B 的 GGUF 量化体积-精度曲线很直观。

顺着这波热度,一个月经问题又被翻了出来:微调大模型,到底选 Unsloth 还是 LLaMA-Factory?别小看这个问题,知乎上这都讨论两年了。有意思的是,对完最近的知乎回答、B站教程和公众号文章之后,我发现大多数人从起点就把这题做错了——把它当成二选一,而真实答案比这有意思得多。
先把两个框架摆上桌面
维度 | LLaMA-Factory | Unsloth |
|---|---|---|
定位 | 一站式后训练集成平台 | 微调加速器 + 训练量化一条龙 |
社区热度 | GitHub 37k+ Star,用户最多的开源后训练框架之一 | 训练加速起家的 Python 库,屡次冲上 GitHub 日榜 |
上手方式 | WebUI + CLI,可零代码 | Python / CLI,新出 Desktop 桌面客户端 |
模型支持 | 100+ 大语言模型与多模态模型 | 500+,含视觉、TTS、embedding |
微调方法 | 全参、冻结、LoRA、2-8bit QLoRA,另有 GaLore、DoRA、PiSSA 等几十种算法 | LoRA、QLoRA、全参、预训练、GRPO、DPO、FP8 |
招牌能力 | 算法覆盖全、国内生态成熟 | 官方宣称 2 倍训练速度、省 70% 显存,自家 Dynamic GGUF 量化 |
看表格有两点要先说清楚。第一,Unsloth 那个「2 倍速度、省 70% 显存」是特定实验设置下的官方口径,不是普适承诺;QLoRA 之所以省显存,主要是把基座模型冻在 4bit,这是 QLoRA 路线的共同红利,Unsloth 的额外贡献在内核级优化。第二,LLaMA-Factory 的加速项清单里,有一个很扎眼的名字——Unsloth。
反常识的结论:两者不是二选一
没看错,LLaMA-Factory 已经把 Unsloth 作为加速后端之一收了进去,和 FlashAttention-2、Liger Kernel 并列在同一份加速技巧清单里。知乎也就是说,在 LLaMA-Factory 里配置训练时启用 Unsloth 内核,等于一边用着它的 WebUI 和算法生态,一边拿到一部分速度和显存优化。所以真正的问题不是「选哪个」,而是「你的场景更吃哪边的招牌能力」。
按人群拆一下:
你的痛点是「不想写代码、想试各种算法、要国内生态」→ LLaMA-Factory。 WebUI 加中文文档,再加 Alpaca / ShareGPT 两种现成数据格式,对第一次微调的人是最省心的路线。它支持的 100+ 模型看着比 Unsloth 的 500+ 少,但每一个都被社区反复验证过,从 Qwen、DeepSeek 到多模态,叫得上名字的热门模型基本都在。
你的痛点是「显存紧张、训练速度紧张,训完还想马上用起来」→ Unsloth。 它的招牌就是压榨硬件极限:27B 模型走 QLoRA,最低门槛大约 22GB 显存,24GB 桌面卡刚好够得着,16GB 笔记本卡则差出一截。哔哩哔哩训完还能直接导出 safetensors / GGUF / NVFP4 / FP8,接 llama.cpp、vLLM、Ollama、LM Studio 一条龙。知乎
你两个都想要 → LLaMA-Factory + Unsloth 加速。 这是大多数进阶用户当下的最优解。
给想冲 Qwen3.8-27B 这波的人泼盆冷水
如果你打算趁这波微调 Qwen3.8-27B,先说好消息:这模型本身确实能打,8 月 14 日开源刚满一周,3-bit 量化版能不能干活已经有人替你在 16GB 显卡上验证过了。知乎实测里 3-bit 量化版在 QuixBugs 编程修复基准上跑出了 93.1% 的修复率,30 个任务修对 27 个。

但坏消息是,选工具之前先算显存账,结论有点残酷:
全量微调 27B:每个参数大约要 18 字节(权重 + 梯度 + 优化器状态),总显存 486GB,没有机房级多卡就别想了。哔哩哔哩
QLoRA 路线:最低门槛 22GB 上下,24GB 单卡能跑但余量不多;16GB 卡的结论就俩字:不够。
手里只有 16GB 甚至更少,不如老老实实微调 Qwen3-8B:8B 走 QLoRA 显存不到 10GB,而风格、格式、领域话术这类注入任务,LoRA 的效果未必吃底座大小。知乎
再补一个避坑提醒:显存紧张时别指望 DeepSpeed ZeRO-3 offload 来救场,单卡加 LoRA 的组合下它有已知的崩溃问题,掉进去排坑的时间成本比省下的显存贵。哔哩哔哩
LLaMA-Factory 社区文档里还有一张硬件需求表,按微调方法 × 模型规模列好了显存门槛,选方法的时候对着查:

接下来怎么做
三句话建议:
第一次微调:LLaMA-Factory WebUI + Qwen3-8B + LoRA,先用 10% 的数据把流程跑通,验证完再扩全量。
有过微调经验、铁了心要碰 27B:Unsloth + 24GB 单卡 + QLoRA,提前备好数据集,一个 epoch 至少预留一整天。
还在纠结要不要花钱:需求是「先试几次看看」的话,租云 GPU 一定比买卡灵活;每周都要用,才值得考虑买卡,这笔账这次不展开。
最后留三个值得盯的信号:Unsloth Desktop 客户端的后续进化——它现在把训练、推理和 Agent 工具链缝在了一起,三大平台齐发。知乎LLaMA-Factory 会不会跟进更深度的 Unsloth 集成,以及层流式低显存训练什么时候工程化成熟——已经有框架能在 4GB 显卡上微调 8B 模型,峰值显存只要 3.32GB。哔哩哔哩这三件事任何一个有动静,这篇的结论就得更新。