9月3日GPT-6 Astra上线,官方口径是"第一个为做事而生的模型":105万上下文、能自主操作电脑,黄仁勋甚至放话AGI已正式到来。 但在真金白银用API的人这里,这周吵上热帖的不是能力,是账单。知乎实测帖的共识一句话:“干活快,额度也掉得快”——用户体感Astra的token价格是5.6 Sol的2.5倍,但单任务成本约1.5倍。 官方说明里也写明,Astra、5.6 和 5.5 的快速模式均按标准额度费率的2.5倍消耗(按官方Codex点数口径,每百万token输入/输出为250/1250对100/500)。微博知乎知乎
同一周,本地阵营也在复活。知乎问题《现在怎么没有人提用AMD MAX395去跑本地大模型了?》上个月的风评还是"凉凉了",9月11日被顶上了热答——导火索是Qwen3.8-Flash-Next这批"高容量、低带宽需求"的MoE模型。 于是很多中度玩家又开始动那个念头:订阅越涨越凶,我是不是该买台1万5的大内存小主机,自己跑模型,从此不用看额度?知乎
这篇就写给付费AI重度使用+想装机观望的人:你的决定不是热情题,是三笔账。
第一笔账:本地能力现在到底到哪了
老机器党印象里的"本地跑大模型",还停在"显存劝退、智商感人"。这批Flash模型改了规则:Qwen3.8-Flash-Next总参数176B、激活只有6B,MoE架构对显存容量的压迫大减,连引进的技术视频标题都直接叫《显存不再是本地大模型唯一瓶颈》。 B站还有人把Qwen3.8-Flash魔改llama.cpp塞进2080Ti,短文本跑出接近50 token/s。哔哩哔哩哔哩哔哩
395这一档的真实数字(热答主口径):Q4量化裸跑decode约25 token/s,配上MTP投机解码后速度完全可用。 真正的短板是prefill只有300多token/s——丢一份十几万字的长文档进去,等首字的时间你要有心理准备。知乎
能力坐标(社区共识,不是官方榜单):知乎52赞回答给的标尺是,Qwen3.8-Flash-Next跑Q8量化,国产模型里"只有4个能稳赢它"——Kimi K3、GLM5.3、Qwen3.8 Max、HY4预览版,大致国模前五的水平。知乎
但要跑Q8,机器预算直接跳到7-8万档:两台DGX Spark,或一台Mac 256G大内存档。知乎

所以第一笔账的结论:1.5万这一档,本地已经从"玩具"跨过"能干活"及格线,但能力摸到的是"国产Flash上位圈",不是Astra那档的天花板。
第二笔账:机器本身,正在被内存涨价背刺
你想省订阅费,硬件商也想赚你的钱。站内商品库的真实价格:
机型 | 现价 | 站内历史低价 | 涨幅 |
|---|---|---|---|
AMD 395迷你主机(极摩客,128G档) | ¥14,699 | ¥10,699(2025.09) | +37% |
零刻AI工作站 | ¥25,759 | ¥10,934(2025.10) | +136% |
RTX 5090 | ¥43,999 | ¥29,999 | +47% |

根源是内存超级周期:16GB DDR5笔记本条已经涨到1500元上下,有装机攻略直言是"买内存送电脑"级别。 知乎专设讨论:涨价潮或将持续到明年——HBM和服务器大容量内存正在吃掉DRAM颗粒产能。 换句话说,去年¥10,699买到395 128G的窗口,不是"错过了",是结构性关闭了。知乎知乎
顺手拆个乐子:AMD上周展示的"桌面AI超算"Threadripper Halo Station,96核配4张MI350P、576GB HBM3e,宣传能跑万亿参数——按Kimi-K2.7-Code的IQ4-XS量化497GB算确实装得下,不算硬吹。 但整机按现价估下来80万到100万,2027年才上市。这是把一柜子数据中心塞进了一个机箱,和"要不要买台主机跑本地模型"没有关系,看个热闹就好。知乎

第三笔账:云端不止Astra一条贵路
本地党最大的对手其实不是涨价的GPT-6,是几乎白送的国产档:DeepSeek V4.1 Flash挂着"每日10亿token无限白嫖"的档,豆包2.1、GLM5.3、Qwen3.8 Max每天都有免费额度。 知乎有人拿40道编程题横测gpt-6-astra、claude-opus-5、gemini-3.8-flash,同任务价格差能到约83倍。哔哩哔哩知乎
那个52赞回答给的及格线公式值得抄下来:电价+折旧 < token套餐,且能力合格、速度不拉胯。 纯跑国产Flash级别的任务,电费确实已经低于订阅了,这账成立;但三件事云端买不回来——数据不出机器、不看429限流和量化降质的脸色、离线永远在线。知乎
谁该买、谁该等、谁别碰
适合买:合同、病历、内部代码这类数据不能出门的;日用量大但任务基本停在国产Flash水平的;以及乐意折腾调优的Geek——25 token/s+MTP确实够日常。但按现价买要认:你是在为内存超级周期付溢价,能蹲到历史低价位的二手/官翻档,别碰全新高价。

适合等:目标是用本地平替Astra/Opus干复杂agent任务的,你该等的不是硬件降价,而是下一代开源权重——模型放出节奏比内存扩产周期快得多;"等内存降价"的等等党反而别太乐观,业内口径这轮要持续到明年。
不适合买:日常就写文案、答问题、偶尔翻译的——免费档完全够用,一万五够你充三年订阅。
下一步盯什么
395档大内存主机的站内价格警报:跌破12000再谈"现在买值";
MTP/投机解码整合包是否一键化:直接决定395的速度体验下限;
OpenAI订阅与额度规则的下一步调整,$200 Pro档近期已出现暂停购买的社区讨论,涨价不会是终点。知乎
内存合约价与HBM产能新闻:这是本地装机党的"大盘"。
一句话收束:GPT-6的涨价是真的,本地模型的及格也是真的——但1万5这台机器到底值不值,取决于你的任务在不在"国产Flash上位圈"以内。在,电价确实比账单温柔;不在,这台机器只是让你用更贵的电费,跑一个更弱的模型。