t/s之争终于有人算到底了:零刻那台395,先把BIOS里焊死的64GB放出来

源自64位全网作者

11:46

零刻的高端局里,最吵的一直是"395那台机器":涨到两万八值不值、128G板载内存是资产还是负担、到底能跑多大的模型——每次吵到"每秒多少token"就散伙,因为没人拿同一台机器、同一个模型、同一套口径算到底。9月24日,知乎一位车主把这本账算完了,结论比数字更扎心:他这台零刻AI Max+ 395(128GB统一内存、8060S核显)跑新出的halogen-flash-server,第一遍只有官方宣称速度的一半。 而隔在中间的,除了引擎,还有一个出厂就躺在BIOS里的设置。知乎

t/s之争终于有人算到底了:零刻那台395,先把BIOS里焊死的64GB放出来

一刀割在BIOS里:128GB到手只剩61GiB

事故现场:装好引擎、拉下Qwen3.8-Flash-Next官方权重,程序直接拒绝启动。敲一行`free -h`,MemTotal显示61GiB——物理上明明是128GB。答案在BIOS的UMA Frame Buffer Size里:出厂把它设到了64GB,核显架构下CPU和GPU共用一条内存池,这64GB被整体划给8060S当显存池。对游戏党是福利,对README要求的"128GB统一内存"环境,等于两万八买的内存一半被物业封了阳台;改回512MB后MemTotal立刻回到122GiB,引擎正常加载。 入门机那头"核显预扣内存"的账,同刀在旗舰上又割了一遍。知乎

t/s之争终于有人算到底了:零刻那台395,先把BIOS里焊死的64GB放出来

两个限定要说白:这是海外在售AZW版395机的孤证,国内GTR9 Pro(同颗395、140W释放、双万兆+双USB4)7月新增的128G+4T顶配卖28599元,出厂默认是否一致,还得等更多车主晒`free -h`。 而"BIOS里给核显分配内存"在这平台上是标准功能,另一篇GTR9 Pro深度实测里写着"BIOS最高可分配96GB作为GPU共享显存",只是没人提醒你想跑大模型要往反了调。微博知乎

三件套之后:22→39.8 tok/s,那5%差在哪

调优路径就三件事:释放UMA(64GB→512MB)、关掉IOMMU、用官方checkpoint。做完的数字:decode从22提到39.8 tok/s(+81%),跑到halogen宣称值的95%;同款395跑llama.cpp+unsloth GGUF一般在12–18 tok/s,"2x"站得住。 34K token长会话第二轮几乎瞬时——拿它当agent常开主机的人最在意这栏;全程不降频、温度低,功耗略高于README标称的~85W。剩下约5%的差距作者查得明白:KV池自动减半(HALOGEN_MAX_TOK=32768触发,README自述约慢9%)。翻译成人话:这台机器的"满血"是有条件的,条件写在README里,不写在商品详情页里。知乎

这个"2x"不是白来的:三种人各有各的账

halogen官方对比llama.cpp:8K/32K prefill快1.9x/2.7x,agent turn快1.9x。它快是因为不通用——专为这一个GPU+一个模型家族手写的kernel;代价同样直白:Strix Halo之外不支持,模型换代得等作者适配。所以适用性分三拨:已在车上、本地跑100GB级MoE当agent主机的,三件套现在就做,UMA和IOMMU不依赖任何新软件;指着"128G板载不缩水"上车的,验车清单加一行——先进BIOS确认内存在不在,再把"依赖单一社区引擎"记进风险项;只打游戏或要安静桌面的,默认64GB显存池对你没准是赚的,别跟风改。至于7月底开卖、11895元起、配24GB推理专用内存的SEi13 AI/SEi14 AI外挂NPU路线,卖的是"便宜一档的本地AI",和395买的"多大模型、多长会话、多快周转"不是一回事,更不是信仰。微博

t/s之争终于有人算到底了:零刻那台395,先把BIOS里焊死的64GB放出来

接下来盯什么

盯四件事:国内版BIOS默认值会不会随固件更新调整;halogen的适配表下一格给谁;同机第二、第三份实测什么时候交作业;以及28599这个顶配价在双11前的走向——涨价潮里"自己装更省"的老公式早就失灵,但这台机器的用户本来也不是按省钱公式买它的。t/s吵了半年,第一次有人把机器、引擎、权重、口径钉死在同一张表上。对准备上395这条船的人,这篇实测最值钱的不是39.8,是那行61GiB——先确认你买到的128GB真的在你手里,再谈跑多少token。

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章