这周的开发者圈子,两件事撞在了一起,而且撞得特别巧。
第一件,大家都知道了:智谱的AI编程工具ZCode被扒出静默上传用户代码。9月18日起,先是有人逆向发现它会在你每发一句话之前,把整个代码仓库打包成加密"快照"传到阿里云OSS——一次313MB。追踪统计显示,上传内容里86.6%是Git提交历史,本地日志还被删了。紧接着多位用户独立取证,发现不止.git,工作树、agents、hooks、skills配置全在包里。证据链越扒越长,舆论彻底炸了。知乎知乎知乎
19号智谱道歉,称这是"代码库索引"功能引发、上传数据不会保存,承诺开源ZCode邀请第三方审查,再给全体用户补一次周额度重置。但承明科技发函称修复后仍检测到上传行为,隐私政策缔约主体在境外的问题也被追问。而到了20号下午,"承诺开源超过1天还没开源"本身又成了一个知乎问题。知乎知乎知乎
第二件,是硬件圈的:就在ZCode被扒的同一晚,B站UP主Jupit3r发布了一条视频——两台E人E本EBOX G95迷你主机,用一根雷电线对连,拼出240GB的"显存池",把原本要4张以上4090才能装的DeepSeek V4-Flash 284B模型跑了起来,生成速度超过10 tokens/s,两台合计4万出头。这条视频B站5900多播放、53条评论,小红书版本81赞72藏。哔哩哔哩

而它评论区点赞最高的一条,恰好接住了第一件事:“智谱zcode再次给大家上了一课,本地部署对于注重隐私性的人来说有多重要”,32个赞。隐私焦虑负责点火,硬件生态负责接住。这周AMD锐龙AI Max+395(圈里叫Strix Halo)迷你主机的动静,值得每个想搞本地部署的人认真看一眼。哔哩哔哩
395这一年:从"除了显存什么都没有"到等来杀手级应用
先给不熟悉的同学补30秒背景:395是一颗为AI特配的APU,16核Zen5、Radeon 8060S核显、最高128GB板载统一内存,但显存带宽只有256GB/s、GPU算力约59.4 TOPS。翻译一下:它装得下大模型,但跑得不够快——带宽就是天花板。知乎
知乎用户星空灵核9月16日发了一篇长文,把395这一年的沉浮梳理得很完整。上市初期ROCM驱动糟糕,能跑的只有小模型,“除了显存什么都没有”;2025年8月等来第一个高光——gpt-oss-120b,117B总参/5.1B激活的超稀疏MoE,量化后60-63GB,民用显卡没一个装得下,395凭128G统一内存完美卡位,llama.cpp社区把它优化到近1000 t/s的prefill、47.5 t/s的生成。结果只风光了两个月,10月英伟达DGX Spark上市,prefill 1939 t/s,把王座抢走了。而这,还只是开始。知乎
之后的日子更难受。100B级新模型一个接一个(glm-4.5-air、qwen3.5-122b-a10b、nemotron-super-120b……),395上手一跑,全是熟悉的"300多pp、15tg"——prefill三百多token/s、生成15 token/s。这个成绩当聊天机器人凑合,但今年coding agent和办公agent兴起后,直接被判不合格。今年7月31日DeepSeek V4-Flash开放权重,284B、性能有gpt-5.6-luna的95%,社区沸腾,结果起飞的是DGX Spark:靠ConnectX-7的200G机间互联,双机跑出约1700pp/75tg。用星空灵核的话说,那阵子"很多人是真动了二手395找人接盘的念想"。知乎

转折就出在这两周。先是qwen3.8-flash-next出现——125B主体+51B n-gram(可以放SSD)、激活仅6B,性能评价直追qwen3.8 max,配方像极了当年的gpt-oss,社区拼命优化:特调llama.cpp把prefill从548推到660再到800 t/s,生成28-35 t/s。但这些,还都只是llama.cpp框架内的热身。知乎
然后是真正的主角:一个闭源推理引擎halogen-flash-server,专门吃透395架构。星空灵核自己用Ghidra逆向了9个版本确认没有后门和作弊后放出了安利,结论是"395终于等来了属于它的杀手级应用,正式从玩具蜕变成生产力工具"——连见多识广的kyuz0跑出750 t/s prefill都被认为是"没配置好"的水平,可见作者的实测成绩在什么档位。当然,这块饼不是白吃的。知乎
halogen仅支持Linux、建议直接进无头服务器模式(这台机器就不再干别的了),最多4并发但速度均分,而且闭源——作者承诺成熟后开源,目前还没兑现。这周大家刚围观完一个"承诺开源"的故事,这张期票值多少,各位自己掂量。知乎
这一周,395整机扎堆上新
软件破局的同时,硬件端这周也热闹得不正常:
天钡NEX395,9月20日被多位博主放出:12999元,64GB板载+1TB固态,3个PCIe4.0盘位、双USB4、双2.5G网口、VC均热板+独立固态风扇,拷机稳定120W。官方思路很直白:双USB4就是给你组集群用的。还附赠一条选购法则——常跑的模型体积低于50GB选64G版,超过50GB直接上128G版。知乎
FEVM(奋微)FAEX1:把160W释放的395塞进1升体积,靠超大均热板压住,这是它家第二款395机型。哔哩哔哩
雷神水冷迷你AI工作站:395上水冷,官方宣称跑AI负载核心温度76℃、长烤不掉速,能跑120B级模型。知乎
海外博主实测192GB内存版395跑300B级模型,B站中字版9月19日上线——128G之上的内存天花板也被捅开了。哔哩哔哩
再加上此前的铭凡MS-S1 Max、零刻GTR9 Pro、极摩客EVO-X3、芯盛美MAX395,395整机的选择从来没这么多过。

为什么厂商扎堆?有个不太舒服的解释:9月内存行情疯涨,散条DDR5一天一个价,而395的板载LPDDR5X在整机报价里提前锁了成本——对厂商是卖点,对消费者是"焊死不可升级"的另一个名字。知乎已经有网友晒出算力周边的涨价账:A4000从7000买到2万+,RTX 6000 Pro从7万涨到18万。这个背景下,板载大内存整机反而成了少数价格稳定的选项。知乎
四条路线,一本账
想搞本地部署的人,现在面前实际是四条路。把本周能核实的数字摆进一张表:
路线 | 现在的花费 | 实测能干什么 | 适合谁 |
|---|---|---|---|
A. 单台395(128G) | 整机约1.3万-2万;64G版天钡NEX395首发12999元,128G准系统曾探底1万 | qwen3.8-flash-next:550-800pp/28-35tg(llama.cpp特调),halogen更高一档;gpt-oss-120b约1000pp/47tg;Qwen3.8-27B约30+tg | 被ZCode这类事件劝退、想把coding/办公agent搬回家的人;能接受Linux无头 |
B. 双395集群 | 4万出头(两台E人E本G95) | 240GB内存池,DS V4-Flash 284B装得下,生成10+tg | 已有一台想加装的、或纯极客;评论区共识是"实用性不如加钱DGX" |
C. DGX Spark | 新机36888元;二手已从2.1万回弹到首发价 | 单机1939pp/56tg;双机284B约1700pp/75tg;三机直连DS V4.1-Flash单流30+tg;CUDA全家桶可微调 | 要CUDA生态、要微调、要200G互联的;但二手回弹原价的当下不是买点 |
D. 等RTX Spark | 价格未公布 | 英伟达面向消费者的Windows平台,N1X芯片,10月全球开卖,两个型号;AMD这边AI Max+ PRO 495工作站也在对位(《微型计算机》已发对比稿) | 离不开Windows、不急用的;但要留意等待成本——内存还在涨 |
几条判断,说清楚依据:
路线A是本周变化最大的一条。"395只能当聊天机器人"的旧结论,是被qwen3.8-flash-next+halogen这套组合推翻的——prefill从300档跳到800上下,意味着长上下文喂料、agent多轮工具调用这些真正吃prefill的活儿能干了。1.3万-2万的入场价,对比双DGX Spark的7万+,它是目前"实用级本地AI"最便宜的门票。前提是你接受:Linux、无头、halogen闭源。
路线B别冲动。双395跑284B是本周最浪漫的极客叙事,但10+tg的生成速度,评论区自己人都说"装了也没用,慢得没法玩"“理论上2台就能部署,但跑DS不能用,不如多加2万买DGX”。这条路线的真实定位是折腾和验证,不是生产力。哔哩哔哩
路线C贵在生态,亏在买点。DGX Spark的性能和CUDA生态没有争议,争议在时机:二手刚从2.1万的谷底回弹到首发原价,说明7月底那波"395用户想接盘、DGX用户想上车"的置换潮把价格顶上去了。追高原价二手,不如等下一波回落。知乎

路线D的等待是有价格的。RTX Spark十月开卖、495 PRO版内存更大(192GB对128GB),听起来都值得期待;但内存行情一天不回落,"等等党"在整机价格上占不到便宜——这和今年笔记本、迷你主机全线涨价是同一个逻辑。知乎

下单前,五个坑再检查一遍
内存档位一步到位,50GB是分界线。板载不可升级,天钡那条"模型超50GB选128G"的法则可以直接抄:qwen3.8-flash-next、gpt-oss-120b都在60GB上下,64G机器(留掉系统开销后)基本塞不下,128G才是本地AI的起步档。知乎
想清楚你要的是"能聊"还是"能干活"。15tg的老395体验当chatbot够用;要跑coding agent,认准prefill数百+tg 30以上,买前用目标模型实测,别信通用跑分。知乎
Windows用户先看显存分配。有实测发现Windows下统一内存的显存分配方式直接影响推理性能,官标"最多96G可分配"和实际表现有出入;认真跑AI的,目前生态还是偏Linux。知乎
halogen的闭源风险自己评估。逆向9个版本没发现后门是事实,但"承诺开源未兑现"也是事实。生产环境依赖闭源推理引擎,和依赖一个不开源的编程agent,是同一种风险。
小品牌整机,售后按最坏情况预设。天钡、FEVM、E人E本、芯盛美这波的共同点是品牌小、渠道浅。到手30分钟先验机(内存容量、盘位、拷机温度),重要数据别只放这一台——迷你主机的售后坑,之前已经写过一整篇,这里不展开。
最后
ZCode这件事最讽刺的地方在于:它承诺的"开源审查"到今天还没落地,而395生态里那个真正提升体验的halogen,同样是一张未兑现的开源期票。本地部署的初衷是"数据不出门、一切可验证",这条路上软硬件都还带着草莽气——但本周之后,“一万多块钱把隐私和agent一起搬回家”,第一次从段子变成了可执行的方案。
继续观察的四个信号:RTX Spark十月的定价(决定路线D值不值)、ZCode是否如期开源(决定隐私事件的长尾热度)、halogen是否开源(决定395生态的天花板)、内存行情何时回落(决定所有整机的价格底)。有进展值得聊,我再来更新账本。
你在用395跑什么模型?或者被ZCode吓到准备入坑本地部署了吗?评论区聊聊,互相避个坑。