「装上了,token也自由了,然后呢?——慢。」
这是九月中下旬本地部署社区出现频率最高的一句话。小红书上一个5080用户的自述很典型:在一台5080+32配置的win电脑上装了本地的Qwen3.8-27B模型,以为可以token自由,结果还是太慢了,底下堆了52条评论。 知乎那个速度调查提问三十几万人路过、70个人留下自己的实测数字:关于QWEN3.8-27B,大家的速度都是多少tokens/s? 从2080Ti配机械硬盘的洋垃圾整机,到把家用显卡调教到极限的优化长文,高赞结论高度一致:50-60tps基本就是这张显卡在现有运行环境下能得到的理想结果了。 对已经上了24G显卡这条船的人来说,瓶颈早就不是「装不装得下27B」,而是「一天到晚跑任务,它到底快不快」。小红书知乎知乎
9月17日起,这个「快」字有了一个国产新答案:中国电信人工智能公司发布并开源Xing4.0-29B-A4B,总参数29B、每token只激活约4B,原生支持256K上下文、量化后15GB显存即可本地部署。 模型已经在GitHub、Hugging Face、Gitee、魔搭、魔乐等平台开源上线,并同步支持API调用。微博量子位
发布三天,这个模型就冲进了HuggingFace模型趋势榜第四。 消息热归热,但这不是「看到30t/s就无脑换模型」的选题。把官方数字、社区实测和工程细节拼在一起,这周真正值得算的是三笔账。量子位
第一笔账:速度账——「激活4B」改变了什么
先泼冷水:激活4B不等于只要4B显存。Xing4.0-29B-A4B是64路由专家、Top4激活的细粒度MoE,全部29B权重还是得躺在显存里等调用,官方给的15GB就是量化后整个模型的占用。 16G卡用户别急着高兴——这是贴着线跑;真正受益的是本来就握着24G卡的人:不换硬件,智力档位从27B稠密换到30B级MoE,带宽压力反而更小。知乎
这正是MoE对稠密模型在本地跑法上的根本差别。稠密27B每生成一个token都要完整搬运27B参数,决定速度的是带宽不是算力,FlashAttention作者Tri Dao那句被本地圈反复引用的话就是这个意思:慢的真正原因不是算力,而是数据搬得太慢——算力堆得再高,也是白搭。 而MoE每个token只激活约4B,单请求搬运量降一个数量级;长上下文再靠MLA压缩KV Cache、靠MTP多token预测提速,这套架构和DeepSeek-V3一个路子——671B总参数、每token激活37B,把成本打下来的底层逻辑就是「按激活参数算账」。微博
但这条账有容易被忽略的后半段。微博上做本地LLM实测的村民F_这周专门发长文纠偏:本地运行AI最大的问题不是解码速度这一个数,而是计算资源/服务容量。 他用真实Kimi Code会话裁到32K、64K和128K上下文分别测并发,单点tok/s数字在长上下文Agent负载下会大幅缩水。知乎上的工程化讨论也说得更直白:集群够大、并发够多的时候,MoE的推理成本确实更接近「按激活参数算」,但那只是趋近,不等于一个4B稠密模型。微博知乎
所以正确算法是:单条消息日常问答,调优过的27B稠密同样能跑到50-60t/s,MoE优势不明显;一旦拿本地模型连续干活——多步Agent、仓库级代码、长文档吞吐——MoE在带宽、并发和长上下文上省下来的,才是3090们真正缺的那块。
第二笔账:能力账——官方跑分和一手实测对得上吗
官方基准相当能打:在性能表现上,模型在 SWE-bench Verified 取得 75.0,在 SuperCLUE 智能体能力评测中得分 93.52、位列第 3 名,Terminal-Bench 2.1的57.5也同时超过了Qwen3.6-35B-A3B的51.5和Gemma4-26B-A4B的30.0。 75.0这个数几乎咬住35B-A3B的76.0,而后者每次激活的参数接近它的两倍。知乎
跑分之外有了第一批一手实测。刚做过Qwen3.8-27B本地评测的刘聪NLP在9月22日发帖:这个模型修一个带翻页漏项、大小写不一致的中小型Python项目,3min就修改好了,并且自己做了回归测试,修改后全部通过;但让模型用Three.js做体素日式庭园时他也明确留了槽:这个效果怎么说呢?感觉有点意思,但是整体效果没那么好。 日常办公件(PPT、会议纪要、音频整理)他能胜任,花活效果一般——这就是一个Agent特化模型该有的样子。知乎
两个信号叠起来,定位很清晰:它不是又一个陪聊模型,也不是Qwen3.8-27B多模态用户的替代品,而是奔着「给我一个目标、我把事做完」的Agent场景去的,模型针对 OpenCode、Claude Code、OpenClaw、Hermes 等主流 Agent 与代码框架做定向适配调优。 官方演示里有一份200页的投标文件交过来,模型能在本地用约20分钟,完成技术、商务、价格三个方面的初评,并逐条给出评分依据。知乎量子位
电信自家的智能客服私有化场景已经上线了这套方案,这套方案的复杂业务办理成功率已经达到90%以上。 注意这是官方口径——企业要参考,得自己POC。量子位
第三笔账:门槛账——三个坑,踩到就是白折腾
第一坑:Ollama党暂时没票。模型已向vLLM、SGLang、TensorRT-LLM、llama.cpp、KTransformers五个推理框架提交适配PR,但目前相关 PR 尚待合入上游主分支,官方已提供启动示例的只有 vLLM、SGLang 和 KTransformers。 llama.cpp上游没合入,就意味着习惯「ollama pull一下就跑」的用户这周只能把模型链接存进收藏夹。知乎
第二坑:参数不是随便给的。官方建议复杂推理与通用任务推荐设置 temperature=1.0、top_p=0.95、repetition_penalty=1.05;代码与智能体任务可将 temperature 调整为 0.8,而且模型输出带思考过程、最终回答在think标记之后,做应用接入的解析逻辑得先照这个写。知乎
第三坑:16G卡用户理论上有异构这条路,但得自己验证速度。官方部署方案明确支持KTransformers的GPU与CPU异构计算跑MoE;同一周知乎上moe-l2项目已经靠「把不用的专家留在内存里、用到的才进显存」做到10-11G的小卡,跑16B、32B甚至157B的MoE模型。 能跑和跑得爽是两回事,这类方案的速度数字要等第三方实测。知乎
谁该换、谁该等、谁不用动
手里是3090/4090/5080,日常拿本地模型跑Agent、写代码、处理保密文档:值得现在就上手,24G显存几乎是给这个卡位量身定做的;预期放在「干活快」,不是「聊天像人」。
16G及以下显卡:等两周——等llama.cpp/GGUF生态跟上、等KTransformers路线出第三方速度数字,再决定是折腾异构还是干脆别动。
已经把Qwen3.8-27B调教到满意、主要用途是聊天和多模态:不用动,这个模型不是冲着你的场景来的。
企业私有化、数据不出域需求:进评测名单,但把官方那串90%和30t/s写进POC验收项,而不是当成采购依据。
最后:这周值得收藏的观察信号
Xing4.0-29B-A4B不是孤立事件。同一周,论文端在研究普通消费级PC把35B MoE权重放进SSD照样高速推理,手机端靠Flash-MoE引擎在1.4GB内存下跑起35B-A3B,原理同样是 Qwen3.5-35B-A3B作为MoE架构,每token仅激活3B参数,其余专家按需从SSD流式加载。 「用架构换带宽」正在成为显存涨价潮之下,本地部署圈的第二条逃生通道。接下来盯三个信号就够了:llama.cpp适配PR什么时候合入、社区在24G卡长上下文下跑出来的真实吞吐数字、以及「Qwen3.8-35B-A3B」这个许愿池里的东西阿里什么时候真做出来。哔哩哔哩
显存买不起的解法,也许从来不是攒钱买卡。