卖大模型的,开始劝你别总用自家最好的模型。
8月26日晚,千问办公首发上线刚刚发布的Qwen3.8-Flash模型,同时推出标准模式,即日起所有用户都能免费体验。 公告附带的性能数字是:真实办公场景实测单任务生成速度快约100%,Token消耗平均少75%。 官方口径更进一步:往后模型供给只有标准、高级两种模式,95%的日常办公任务标准模式就能完成,只有少数复杂任务需要高级模式。速途网微博蓝字计划
这句话出现的时间点很微妙。8月3日开启公测的千问办公,首月用户突破3000万、企业用户占比过半。 9月7日,它又推出号称业内首个的"多人工作台",一句话生成最多百人在线协作的专属工作台。 至于3000万这个拉新数字本身,社区里也有人开始较真口径。 再加上"每天送积分"的钩子,大量文档党已经装了桌面版,但卡在同一个犹豫上:免费的"标准"到底是够用,还是简配到不能用?新识研究所华军软件园微博
9月14日,独立测评蓝字计划拿一份真实硬活测了两种模式:9份券商研报,整理成一份Word、再压成一页汇报PPT。知乎问题页里对这场实测的概括是五个字——“结果有点微妙”。 但微妙在哪一步、对谁微妙,比结论本身有用得多。拆开看,这是三个可以直接抄走的问题:标准模式到底能交付什么?高级模式贵的到底是不是"文笔"?以及,积分这本账到底该怎么算。知乎
一、标准模式交出来的,是一份"能读的综合摘要"
蓝字计划的测试专门埋了坑:9份研报里有两份文件名不同、内容完全一致。标准模式先读取了全部文件,并在执行过程中发现这两份内容相同,去掉重复后确认按8份独立研报处理——这一关过了。蓝字计划
随后10分24秒,它没有按文件顺序逐篇复述,而是把8份材料重新归类:阿里的经营表现一组、AI模型与产品进展一组、各家券商共识与分歧一组被集中整理,最后形成一份包含69个段落、两张表格的Word文档。 这已经是相对完整的阅读主线:想了解收入利润变化能直接翻到对应章节,想知道机构怎么看也不用回8份PDF逐篇找。蓝字计划
分歧部分还把各家对阿里未来利润的预测收拢成918亿元至1284亿元的区间,同时提醒这些预测采用的口径并不完全相同。 这个成品的准确评价是:能帮你快速看懂这批研报在讲什么,但它是摘要,不是底稿——各家为什么得出不同判断、预测背后用了哪些假设,展开有限。要引用具体数据,还得回原研报核对。蓝字计划
二、高级模式和标准模式的差距,是一张清单加7分钟
切换"高级"模式,同样材料、同样要求,产物拉开的差距不在"写得好不好",在留没留底。Word开头多了一张研报清单:券商名称、报告主题、发布日期、机构评级,全部列出。蓝字计划
更要紧的差异在追分歧原因:同样讨论Non-GAAP净利润,华泰预测最高、国信相对保守,相差接近400亿元,高级模式进一步指出差异主要来自各家对AI实验室投入和云业务利润率的假设不同。蓝字计划
PPT环节还多了一轮看得见的自检:第一版出现标题文本框与右侧说明框重叠、橙色文字配白底对比度不足的问题,它自己缩窄文本框、加深文字颜色,再把PPT导出成图片复查有没有重叠和裁切。蓝字计划
代价是时间:同一页PPT,标准模式3分17秒,高级模式10分18秒,耗时超过三倍、多花7分多钟。 但别急着得出"贵有贵的道理"。两种模式的PPT翻车在同一个地方——下面区域塞得太满、小字太多,高级模式那一版同样"投到大屏幕上,很难让人一眼抓住重点"。多花的7分钟买到的是信息完整度,不是"汇报即用"。更详细和更适合汇报,是两回事。蓝字计划
蓝字计划给出的验收方式是:平时只是整理资料、提炼重点、生成初稿,标准模式确实够用;碰上正式汇报或复杂材料,再切到高级模式也不迟——标准模式负责把活干完,高级模式负责把活干得更像样。 换句话说,“95%够用"的真实含义取决于"可用"按什么标准判断:验收线是"我自己再动手改一轮”,标准模式大概率够;验收线是"直接发给领导/客户",那两种模式都没到线。蓝字计划
三、"够用"的另一面:积分这本账,已经有用户晒出对不上的地方
模式选择背后是计费问题,而这几天恰恰有人把千问办公的积分账晒在了网上:知乎用户"傲娇的米粉"贴出三天的积分历史截图,核心一句话——赠送的积分在到账当天,就被以"透支扣减"的名义全部扣除。 按他晒出的记录,当天真实使用都有明确来源和事由、时间也对得上,他自述"没有超支使用";而清零的负数扣减集中出现在同一分钟(如14笔全在09:59),孤零零挂着,没有任何对应的使用记录可以核对。知乎
更早的9月8日,微博就有用户提到"夜里加班把我今天签到的积分用完了,还欠债了。没有查到它在干吗的"。微博
必须说清楚边界:这是小样本用户自证,截至发稿未见官方公开回应,“透支"字段的确切计费逻辑我们无从核实,不该直接定性成套路。但它指向的动作对所有准备长期使用或充值的人是通用的——先核对自己的账单,再决定信不信"够用”。三天就能查完:每天赠送积分到账时间、每笔任务实际扣减数额和来源字段、有没有无法归属的负数。
顺带一提价格锚点:渠道报价里千问办公的积分包100元起购、支持多档灵活订阅。 而标准模式的官方卖点本就是"用更少的积分消耗完成任务"。 标准模式每单任务到底扣多少、送的积分够不够覆盖你的日均任务量,这笔账值得在花钱之前用真实工作跑一周再下结论。知乎速途网
四、场景对照:什么时候标准模式、什么时候高级模式、什么时候谁都别信
你的活 | 建议 | 理由(基于本轮实测与账单机理) |
|---|---|---|
资料归拢、周报初稿、会议纪要草稿 | 标准模式 | 重复文件自检、重归类摘要,实测够用,速度还是高级模式的3倍 |
行研整理、投标准备、任何要引用口径的材料 | 高级模式起步 | 清单、评级、假设差异这些"底"只有高级模式给,且仍需回原文核对 |
直接投会议室的一页汇报 | 两种模式都要人工返修 | 实测两版PPT共性问题:信息塞太满、小字投屏不可读 |
敏感合同、人事、未公开财务文档 | 先过公司合规 | 云端上传型Agent的授权边界,比模式选择优先级更高 |
五、别换工具,先花15分钟做自测
"95%"是官方口径,一次深度测评是单份材料样本,证据覆盖到这里,结论就只能到这里。但有一个动作现在就能做:把你手头一份真实的、带格式要求的材料(不要挑最简单的),标准模式跑一遍,按三条验收——
能不能直接发:不发,但差多少(改结构还是重做);
敢不敢引用:抽查两个数字回原文核对,看它有没有编造或张冠李戴;
扣没扣明白:任务前后各截一张积分余额,对一下消耗记录里有没有对不上号的扣减。
三条过了,免费的标准模式就是你的日常配置;第1、2条卡住的场景再开高级模式;第3条对不上,留着截图,等官方一个说法——这也是接下来最值得盯的信号:积分规则会不会有正式解释,多人工作台的落地数据会不会反过来逼其他两家(WorkBuddy、豆包系)调自己那边的免费额度和模式话术。
AI办公这一年从"聊天框"卷到"替你干活",宣传语会越来越像——“95%够用”“一句话交付”“全球第一”。文档党真正需要的不是信哪句,而是手里有一套自己的验收清单。这把尺,比省下的那7分钟值钱。