Qwen3.8-27B开源满10天了。跑分和教程大家应该都看烦了,今天聊点别的:这模型在全网到底干了哪些真实的活?
我们翻了这10天知乎、B站、小红书、36氪和海外社区的实测案例,先说结论:有4类活儿,它干得比预期好;也有3类活儿,劝你别急着交给它。
先用两句话把预期摆正:
Artificial Analysis 的 Intelligence Index 它拿了52分,和 GPT-5.6 Luna 打平,是本地模型第一次挤进前沿能力区间;但它前面还站着 Claude Opus 5、GLM-5.3、Grok 4.6 三个59分。知乎知乎
27B稠密参数、Apache 2.0协议,量化后16G显存的卡就能跑,Hugging Face 两天下载破100万——热度是真的,普通人能跑也是真的。小红书36氪

那它到底干好了什么?
【活儿一:修老代码、编程里的脏活累活】
B站这几天有条很火的视频叫《屎山考核》:UP主把 Qwen3.8-27B 和 Claude Opus 4.6 放到同一堆祖传代码面前改陈年BUG。结论是:它确实慢、确实啰嗦,但和 Opus 4.6 一样,“也能把活儿交出来了”。哔哩哔哩
这不是个例。知乎有人拿它接 VS Code 写贪吃蛇和俄罗斯方块——这两个小游戏要完整处理结构、状态、事件和碰撞逻辑,它给出的是能跑的完整程序。知乎还有人在3090 Ti 上让它以 agent 模式连续30多次工具调用零报错。知乎编程工具 Cline 官宣,上线才4天,它就成了开发者选得最多的本地模型。知乎
【活儿二:当 Agent 后端,干"批发"的token活】
这是目前大家玩得最花的场景。Ollama 官方支持,两条命令就能把 Claude Code 的后端换成本地模型——不用担心封号,没有API费用,agent随便跑、token随便烧,代码不出家门。社区管这个叫"token自由"。知乎
16G显存党也出了成绩:有人用 AMD 9070 装 unsloth 的 IQ3_S 量化版(权重11.2GB),128k上下文稳定40+ tok/s,“本地干重复的活完全够了,写稿、跑代码、批量处理都没压力”。小红书

还有人接上 Hermes,直接拿它批量产PPT。

【活儿三:专业向的硬活儿】
最出圈的案例来自海外:开发者 Adam Conway 给它派了个原以为只有前沿模型能干的任务——逆向一款商业软件的许可证验证。模型用静态分析翻了几千行 arm64 汇编,把厂商刻意混淆的 RSA 公钥挖了出来,中途哈希对不上还自己纠错重来,全程30分钟搞定。他的原话是:这种活儿以前得拿 Ghidra 一点点磨。知乎
【活儿四:数据不能出门的活】
合同、病历、内网代码——只要"不能上云"是硬约束,这是目前最值得评估的方案。知乎有句话说得直白:对代码不能出内网的公司,这基本是目前最值得评估的方案。知乎
再说劝退的部分。
【别交一:要快问快答的琐碎活】
这模型的默认设置是最大的坑。Simon Willison 让它画个"骑自行车的鹈鹕"SVG,默认思考档位让它纠结"要不要加同心辅助圆"琢磨了21分钟,烧掉2万多个推理token。知乎知乎有人实测:一次312个token的输出里,286个是思考token,占92%。知乎Hacker News 有人拿私人推理题测它:过了,但烧的token大约是上一位通过者的5倍。36氪
不过这是设置问题,不是能力问题:reasoning_effort 调低就能解。小红书社区甚至专门出了 Cold-Fusion 思考压缩衍生版。

【别交二:依赖最新资讯的活】
有人问它训练数据截止到什么时候,它自己答"2026年",一追问2024年之后的具体事就露馅。知乎问它本月发生了什么,还是交给联网的工具吧。
【别交三:超长多轮任务,和对输出要求拉满的活】
社区有反馈,agent多轮长任务里它的输出会被截断,还在等官方修。另外接 agent 时,决定流畅度的不是生成速度,是"读档"速度——每一轮它都要把前文从头重读一遍,上下文越厚等得越久,内存带宽比 tok/s 数字更值钱。知乎
能力上也要说实话:Agentic Index 51分、排第7,压过 DeepSeek V4 Pro 和 GPT-5.6 Luna,但 Claude Opus 5、GLM-5.3、Grok 4.6 的59分还在前面。知乎那篇"token自由"的作者很清醒:“Qwen3.8-27B 现在还替代不了我的生产主力,真正做项目,我还是会打开云端。”
所以到底怎么分工?给个简单对照:
交给本地27B:重复、可批量的脏活累活;隐私敏感、数据不能出门;token烧得肉疼的agent批发活;代码理解、文档分析等专业任务。
留给云端:依赖最新信息的;多轮长链、容错低的;对智力上限要求极高的创作。
最后,留三个继续观察的信号:
agent多轮截断问题等官方修复,这决定它能不能接长任务;
Cold-Fusion 这类思考压缩版、DFlash2 投机解码草稿模型(SGLang 实测单并发吞吐3.4倍),这两个方向正好对着"想太多"和"慢"两大痛点;
16G显存量化版的实测接下来一周还会密集更新——那是大多数人手里的卡。
你让它干的第一个正经活是什么?干成了还是翻车了?评论区聊聊。