过去这两周,千问3.8系列是真火。旗舰模型Qwen3.8-Max 8月初上线,随后27B版本被放上Hugging Face,权重开放两天下载量就突破100万次,连续几天占着全球模型热榜第一。钛媒体 海外最大的本地大模型社区LocalLLaMA,也被千问3.8系列的测试、部署和量化帖子淹没,版主干脆专门开了集中讨论帖。

没跟进这波热度的,可以先对一下规格:总参数量干到2.4万亿,推理一次只激活950亿参数,支持100万Token上下文,文本、图、视频都能作为输入。微博 API同步上线千问平台,权重也陆续开放——但火是火,上手是上手,这篇想聊的是一个更实际的问题:普通用户到底走哪条路最划算,每条路的账怎么算。
热度是真的,但跑分要带着"口径"看
最出圈的说法来自榜单:Qwen3.8-Max在Artificial Analysis的Agentic榜上拿了55.4分,全球第一,把Claude Opus 5和GPT-5.6都压在身后。微博 但榜单拆开看,每个位置的故事并不一样。
Terminal-Bench 2.1考的是模型能不能独立操作命令行、完成装软件、改文件、跑程序这类真实任务,Qwen3.8-Max的平均通过率是86.6%,距离GPT-5.6Sol还差2.2个百分点。钛媒体

换到考"能不能同时遵守多项要求"的IFBench,又是另一个场面:Qwen3.8-Max的提示词通过率达到82.8%,超过GPT-5.6Sol的72.7%和Claude Fable 5的63.5%,这一项直接完成反杀。钛媒体 一个证明它能办事,一个证明它听得懂人话,但都不是全面碾压。所以以后再看到"全球第一",先问一句是哪个榜、哪个分项、什么口径——这话对千问适用,对别家模型同样适用。
路线一:免费通道,观望党先薅这个
只想试试Qwen3.8-Max到底什么水平,眼下最划算的第一步不是付费,是领免费额度。Qoder的一周年福利还在进行:8月3日到9月3日,新用户下载并注册Qoder,可以领300积分加800次Qwen3.8-Max调用。微博 800次调用,足够普通用户把它的脾气摸得清清楚楚,还不用折腾API key,也不用担心账单。
要注意的只有两点:窗口到9月3日,且只面向新用户。老用户要么把已有免费额度用足,要么看看下一条路线。
路线二:API按量计费,接入前把账算清楚
开发者,或者准备把它接进自己工具链的,账就要换一种算法。官方定价是国内输入每百万token 12元、输出36元,缓存命中只要1.5元。微博 这是什么概念?按一次普通对话3000输入、1500输出token估算,单次大约9分钱;一天20次,就是每天1.8元、每月54元上下。对一个2.4万亿参数的旗舰模型来说,这个价格在同级里确实算便宜。还有个容易被忽略的省钱点:如果你的场景要反复带上同一段长系统提示或长文档,命中缓存的部分按1.5元每百万token计,实际成本还会再降一档。另外还有夜间调用5折之类的限时福利,不急的批处理任务可以攒到夜里跑。
这条路线适合"有稳定调用量、能算清成本曲线"的人。三分钟热度想玩玩,免费路线更合适,别上来就充值。
路线三:自部署27B,动手前先看清两条款
最让人心动的,当然是能搬回家自己跑的27B版本。门槛比想象低:4-bit量化版模型文件约16GB,一张16GB显存的显卡就能装下,关掉思考模式后生成速度能到每秒26个token,字往外冒得比阅读还快。钛媒体

但真要装,得先知道两条下载按钮上不会写的条款。
第一,这个"开源",不是开源社区语境里的完全开源。快思慢想研究院院长田丰直接开炮,指出当前开源模型的三大硬伤是只开放权重、自定义协议设商业阈值、缺安全评估,其中Qwen3.8-Max的协议里就写着:产品月活超过1亿,须加标注。微博 也就是说,权重免费下载没问题,但你的业务规模真到了那个量级,就有附加条件。
第二,还有一个没实锤的动向:有传闻说阿里要改Qwen3.8-Max的开源许可证,效仿Kimi K3新增触发商用分成的条款,而K3的门槛是经营收入达到2000万美金后要另签分账协议。微博 如果成真,意味着国产开源旗舰开始统一向"拿模型转卖的大超市"收账。这事还没官宣,先按"待确认"标记,但做模型转售生意的值得盯一下。
个人用户和公司内部自用,倒不用为这两条条款紧张:限制瞄准的是拿模型转售的平台,个人、开发者、企业内部自用不在射程内。微博 但要是想拿它做产品赚钱,就别默认还能像以前那样白嫖,上线前把官方许可证原文再看一遍。
还有一笔现实的账:社区目前最推荐的NVFP4量化版,要吃满性能得换Blackwell架构的RTX50系显卡,而显卡价格最近并不友好——之前人厌狗嫌的RTX5080,已经涨到12999元。钛媒体 模型越来越便宜、硬件越来越贵,自部署要不要搞,得把这笔账合起来算。
两个坑,和值得继续盯的信号
第一个坑,吐槽的人已经不少:思考慢。有程序员吐槽Qwen3.8-Max"你把一个问题报给它,它一不读代码,二不做测试,就开始抱着头长考,一直考,一直考,一直考"。微博 这其实是千问3.8系列的通病:实测27B打开思考模式后,速度会从每秒26个token跌到5个左右。钛媒体 所以建议很直接:日常对话和轻任务把思考模式关掉,真需要深度推理的复杂问题再开,并且把等待时间预留足。

第二个坑,针对本地版:事实性记忆会出错。蓝字计划让本地27B分析显卡参数,它编出了"RTX4080显存带宽约1024GB/s"这种错误数字,实际正确值是716.8GB/s。钛媒体 这是本地模型不联网的通病,不是千问独有的毛病,但它提醒一句:关键数字别让本地版单独拍板,拿在线版或搜索交叉核对一下。
最后留几个值得继续盯的信号:一是商用分成的传闻会不会落地、官方许可证文本最终长什么样;二是Qoder新用户福利9月3日截止,想领的趁早;三是50系显卡价格什么时候回落——那决定自部署这条路,是不是真的能走进普通人家。
风是真起来了,但落在哪条路上,得先看清自己的账。