9月25日,B站UP主"AI观模者"发了条12分钟的测评,标题起得很满:《Swift-Qwen3.8-27B深度测评:神中神模型!思考更少,成绩更好!》。3.1万播放、811个赞、368条评论——评论区比视频本身更像现场:有人说"这就下载转成NInfer格式",有人回了一句"swift的gsq-rco不行,原版71.14分,它68.56",还有人报"1.5版实测同样的任务雷霆思考而且没完成"。哔哩哔哩
这就是本地党这个星期的新战场。上一轮吵的是"8G显存能不能跑125B",这一轮吵的是另一个东西:同一个27B,官方没治好"想得太多"的毛病,一个个人开发者做的微调版说治好了,而且直接发的是GGUF——装完就能用。先说结论:截至10月1日,支持派和质疑派的数据都是真实存在、互相打架的。这篇把全网能翻到的实测点摆进同一张表,给16G—24G显存、真拿27B干活的那批人一个换不换的判断。
一、"雷霆思考"怎么就成了本地党本周的公敌
先补上下文,给刚入坑的:Qwen3.8-27B是8月14日开源的,270亿参数、Apache 2.0协议免费商用、262K上下文,至今是16G—24G显存档的主力干活模型。问题出在它的思考模式上。小红书
这个毛病社区叫"雷霆大思考":一个简单任务,模型能连续想几万token,把KV缓存撑爆、把16G显存顶到上下文重启、把一晚上电费烧进去。它不是本地党独有的怨气——8月6日那条《DeepSeek陷入无尽思考:22小时不回答、不超时、不报错》拿了8.1万播放、2483个赞。9月9日又有人测DeepSeek V4.1"推理速度非常快,耗token速度更快了,但是也是稍微有点这样的推理循环问题,未来各位如果用的时候一定要谨防这个情况"。更早4月那条60万播放的《deepseek:别吵,我在思考》,梗就是这么来的。哔哩哔哩哔哩哔哩哔哩哔哩
但本地党的账更难算。云端的无尽思考烧的是API额度,本地的无尽思考烧的是你的显存、你的时间和你家的电表。小红书10月1日凌晨一篇零赞零评论的帖子写道:“以前一天顶多就4-5度电,现在足足翻了一倍”。这波讨论里被反复引用的还有一句狠话:“16G不能token自由的模型,都是垃圾”。小红书哔哩哔哩
在微调版出来之前,社区的对策是"外挂":8月16日有条1.3万播放的分享《改善Qwen3.8雷霆大思考》,办法是装HuggingFace V22模板、把思考强度锁到"中度"。这类方案不动模型权重,只改对话模板,优点是随时可退,缺点是把思考长度这个本应由模型自己控制的变量,变成了启动命令里的一个玄学开关。9月底还有人提到"解决雷霆思考的jinja模板",属于同一路数。哔哩哔哩
9月15日,有人在小红书发了新发现:HuggingFace上出现了一个叫Swift-Qwen3.8-27B的模型,作者UkisAI,宣传点就一个——思考加速,把思考长度直接压下来。9月28日前后,Swift-1.5-Qwen3.8-27B-GGUF挂上HuggingFace,测评UP主置顶了仓库地址。9月27日又出现第三方搬运打包版本BroLaurens/Swift-1.5-Qwen3.8-27B-NVFP4-GGUF,标注"适合50系显卡"。小红书哔哩哔哩小红书
先排一个坑:很多新人把它和魔搭的ms-swift训练框架搞混——后者8月15日就宣布"Qwen3.8已接入ms-swift:27B、35B-A3B、2.4T-A95B及FP8权重完成注册,专用模板可切换三档"。那是训练工具链。本文说的Swift-Qwen3.8-27B是个人开发者UkisAI发布的微调模型成品,两者唯一关系是名字撞车。UkisAI本人这周高产得像个官方团队:除了Swift原版,还亲自量化了GSQ-RCO版本,连Flash-Next的Swift-1.5-GSQ-RCO都做了——这就是为什么"换Swift"从来不是单一动作,它会拖出一串量化版和引擎格式的选择。小红书哔哩哔哩
二、实测点摆进同一张表:谁在吹,谁在砸
下表全部来自B站视频与评论区、微博、小红书的自述实测,我把原始数字原样搬运,不做加工。注意:除两三条外,绝大多数是个人环境下的自测,没有统一容器、统一题库,这本身就是后面要吵的根源。
支持派的数据
实测点 | 来源 | 数据 |
|---|---|---|
“思考更少,成绩更好” | AI观模者测评(9/25,3.1万播放) | 标题即结论,GGUF直发 |
五样本对照(Q4km-xhigh、ISTA-GSQ-RCO两档、Swift两档) | B站鹈鹕测试对比视频评论区(BV1a9h969E28) | GSQ-RCO的medium档"非常大的劣化";Swift"可以放心用xhigh",质量对标Q4km的xhigh,思考长度仅为原版60%左右 |
16G档位判断 | 对比视频评论区 | “如果保证质量还提速,16G显存用128K上下文就算可用;24G甚至可以k=q8、v=q4跑256K” |
5070Ti 16G + NInfer | B站自测(测评评论区置顶) | Swift S配置128K上下文,页面生成实测解码123.6 tok/s;XXS配置可到160K |
3080 20G + NInfer(IQ3_S GSQ-RCO,模型11G) | 对比视频评论区 | 32K基准:填充约1400、生成130 tok/s;拉到150K上下文:填充974、生成93 |
5090 + Strata跑Flash-Next IQ3_S | Swift测评评论区 | 256K上下文稳定100+ tok/s,“比NInfer的27B还快”——但补了一句"没有27B稳定,有时flash好有时27B好" |
质疑派的数据
实测点 | 来源 | 数据 |
|---|---|---|
租5090复现测评 | Swift测评评论区 | 原版GSQ 71.14分,Swift-1.5-GSQ-RCO 68.56分,低了约2.6;评测需容器环境,镜像写死ID,有的还得自己做,“个人很难复现up评测出来的分数” |
Swift 1.5实机 | 同一评论区(另一人) | “同样的任务雷霆思考而且没完成” |
干活质量 | 对比视频评论区 | “同Q4干活还是不如原版” |
量化档位 | Swift测评评论区 | “swift最强的是q6,q4不行” |
稳定性 | Swift测评评论区 | NInfer在48G显存4090上"把机器干挂了三次黑屏" |
方差 | 对比视频评论区 | 一小时的活跑两遍:一遍半小时结束但"差强人意",一遍一小时但结果好些 |
中间地带
实测点 | 来源 | 数据 |
|---|---|---|
GSQ-RCO速度税 | 对比视频评论区多人报告 | “跟GSQ-RCO沾边的模型都特别慢,只有同大小模型的一半速度”;NInfer最新版已支持SM86(30系),但要自己编译引擎,KV精度最低int8、不支持fp8 |
thinkingcap + NVFP4 KV实测 | Swift测评评论区(5090 32G自测) | k8v4对比nvfp4,各项得分仅低0.1–0.2;KV池大46%,但总时长和总token也差不多——“没有权威项目背书,这下又纠结了” |
QUASAR NVFP4 QAT | ModelScope模型页自述(经评论区转述) | 18G权重,“比大部分NVFP4强、几乎达到FP8水平”(仅见宣传,未见第三方复现) |
无审查版本 | Swift测评评论区 | “无审查别名,前额叶切除术”——破甲与降智被反复验证是同一件事的两面 |
三、分歧其实能合上三半
第一,Swift真正的卖点不是"更聪明",是"省思考"。所有正向数据里最硬的是那个60%——五样本对照,同模型、同任务、同思考强度:"使用GSQRCO的medium会存在非常大的劣化,用Swift可以放心用xhigh,而且质量对标Q4km的xhigh,在思考长度上仅为原版的60%左右”。这是本次唯一一组有控制的自测。支持派的"成绩更好"和质疑派的"分数更低"在统计上可能同时成立:一个说的是同管线内不丢分,一个说的是换管线后复现不稳。哔哩哔哩
71.14对68.56就是"换管线"那一条:租5090复现的测评者说"原版的 gsq 我这环境才 71.14",Swift的GSQ-RCO量化版68.56,而且他补充"个人很难复现 up 评测出来的分数了"——编程测试需要容器环境、镜像写死ID、有的还得自己造。两个数不该直接相减。证据只能支撑到"质量对标原版同档"这个强度,撑不到"神中神"。哔哩哔哩
第二,档位共识比想象清楚:中高量化吃红利,低量化翻车。"swift最强的是q6 q4不行"出自测评评论区。 “同Q4干活还是不如原版"出自对比视频评论区。 再加上"GSQ-RCO的medium大幅劣化”,三条独立自测指向同一个方向:Swift的价值建立在xhigh/Q4km以上的档位上,而这套档位对显存的要求并没有降。8G党看着"思考省60%“心动的,先看清楚省的是时间不是显存——权重该16G还是16G。8G档目前被反复点名能干活的路径只有两条:一是27B的IQ4_XS跑复杂Agent但速度慢,RTX2070八年老兵的实测结论是"IQ2适合写小说,速度尚可,但思维链容易断裂;IQ4_XS可以跑复杂Agent任务”。 二是干脆守9B主力。哔哩哔哩哔哩哔哩哔哩哔哩
第三,黑屏、半速、编译门槛,这些是引擎的锅,别记在模型头上。NInfer最新版虽然支持了SM86(30系架构),但"还是需要自己编译引擎的,Kv精度最低只能int 8不支持fp8"。 "跟GSQ-RCO沾边的模型都特别慢,只有同大小模型的一半速度"是多位用户报告的速度税。至于Strata,它压根不伺候27B:9月28日tombkeeper的微博说这引擎用RTX3090跑Qwen3.8-Flash-Next的IQ3_S量化,“短问答输出速度能到67tok/s,而同样硬件下llama.cpp只有20tok”。哔哩哔哩微博
这条微博下面第一条高赞评论就是在纠偏:"27b是稠密模型,教主说的这个推理引擎看起来主要针对moe+n-gram模型的优化”。所以换Swift之前,先把你现在引擎的账算明白,否则会把部署问题误判成模型问题,退坑怪模型。微博
四、按你的卡做决定:一张对号入座的表
8G显存:别动。Swift省的是思考token,不减权重体积;8G档的答案仍然是9B主力+量化27B勉强,和这轮微调潮无关。
16G(5070Ti/4060Ti 16G):这波唯一明确受益的档位。此前16G+128K被普遍判"不可用",五样本对照后社区改口:“如果这个版本真确实保证质量还提速了,那16G显存用128k上下文真的就已经算可用了”。可试Swift-1.5的IQ3_S/Q3档+NInfer:5070Ti实测"Swift S 配置 128K 上下文,页面生成案例实测解码 123.6 tok/s"。但把预期定在"同样活干得快了",不是"变聪明了"。哔哩哔哩哔哩哔哩
20–24G(3080 20G/3090/4090级别):最划算的观望位。你本来就够Q4km跑128K,Swift给你的增量只是时间——3080 20G的NInfer实测摆在面前:"我3080 20g跑ninfer的gsq rco,填充1400多,生成130,32k基准测的,150k上下文的时候,填充974,生成93”。编程类任务建议等更多同管线复现分再换,"租5090那位"的2.6分差距恰恰出在编程测试上。哔哩哔哩
32G+(5090/4090 48G):两个坑绕开:NInfer黑屏报告就发生在大显存+激进配置上——“ninfer 在我 48g4090 上把我机器干挂了三次黑屏”。 Strata不跑27B稠密。你的问题不是装不装Swift,是要不要为省40%思考时间重做全套配置。哔哩哔哩
Mac和A卡:这轮与你无关。Strata/NInfer全是CUDA侧,评论区原话就是"amd没法用"。 Mac侧也暂无优化,同帖回复里只找得到"针对速度优化的MTPLX"一条线索。你的战场还是统一内存带宽那一套。微博
五、下一步盯四个信号,别急着删旧文件
qwen4.0 27B:评论区已经有人喊"qwen4 马上就要来薄纱民科了",也有人判断10月够呛。如果官方在新版里给了思考长度控制,UkisAI这轮微调的全部意义会当场归零——这是现在不急着全仓换的最大理由。哔哩哔哩
1.5的"雷霆思考没完成"有没有第二例:目前只有一条孤证:“1.5 版本实机测试同样的任务雷霆思考而且没完成”。再翻车两例,1.5就该进黑名单而不是白名单。哔哩哔哩
同管线复现分:需要有人用统一容器、同一题库,把原版GSQ和Swift-1.5-GSQ-RCO再跑一遍。71.14对68.56这条线,差2.6是噪声还是真实劣化,决定这波换不换。
搬运链的权重来源:第三方搬运包已经挂出来了,连笔记标题都起了《这个Qwen3.8-27B的版本不错》。 这些包是否还是UkisAI本体权重,下载前对一下HuggingFace原仓库的文件哈希。小红书
最后说一句圈层的部分。这波"民科微调"底下吵得最凶的不是分数,是身份:“qwen4要来薄纱民科了"那条评论对面,有人拿Steam创意工坊回怼,原话是"贝塞斯达这种靠mod社区生存的游戏公司你怎么看?”,还有人追问"如果民科在继续优化qwen4呢?"。本地大模型这圈子的荒诞和魅力都在这:官方修不掉的毛病,社区先动了刀,而且刀法、战绩、翻车记录,全都摊在评论区,由每一个决定换版的人自己验收。哔哩哔哩
这份表也一样。证据覆盖到哪里,结论就只能到哪里:Swift-1.5在16G档"省思考、质量对标"目前值得试点,在编程任务上"不掉分"还没有成立。换不换,按你的卡对号入座。