395主机这周突然白捡一档性能:Halogen峰值48.58t/s、llama.cpp"最多25"党坐不住了——装之前,先把速度、翻车、补丁这三本账对完

源自76位全网作者

02:42

这周的硬件账不好对:AMD全系涨价的传闻和内存暴涨同时在热搜上挂着。尽管AMD尚未确认将提高Ryzen处理器的售价,但台积电晶圆成本上涨,仍可能导致AMD处理器价格走高。但在本地AI这个小区块里,另一条线这周悄悄刷屏了——不用换硬件、不用加内存,395主机的推理速度直接翻档。微博

六天,四篇帖子:这波是谁带起来的

  • 9月11日,海外开发者 Donato Capitella 在YouTube发布《Qwen3.8-Flash-Next on AMD Strix Halo: Halogen, N-grams and Benchmarks》,第一次把 Halogen Flash Server 这个引擎摆上桌面:用128GB统一内存的 Strix Halo 讲清 learned N-gram embeddings 的机制,并对比 Halogen Flash Server、EngramHalo 与 ROCm/Vulkan llama.cpp 各配置的本地推理表现。哔哩哔哩

  • 9月12日晚,B站UP"量子菠萝_"把横评字幕化,中文社区第一次有了完整对比。

  • 9月15日,B站UP"titan909"发部署实测,4874播放带出76条评论、93次收藏——收藏/播放比是这类教程内容最诚实的需求指标。

  • 9月17日上午,知乎用户"怂中求稳"发出395主机的全量部署作业:系统版本、内存划拨、功耗墙、Docker命令,一条不落。

引擎叫 Halogen Flash Server(GitHub仓库 peonist-ai/halogen-flash-server),跑的模型是 Qwen3.8-Flash-Next。它对准的,恰好就是上个月395车主们骂得最狠的那件事:模型没变笨,是prefill太慢、上下文一长整个对话就"越聊越慢"。

第一本账:48.58t/s是真的,但先把"峰值"和"日常"、"prefill"和"decode"分开

横评口径(Donato实测,Strix Halo 128GB,32K上下文):Halogen在32K上下文下Prefill达752 tokens/s,生成41 tokens/s;Terminal Bench Mini测试中Halogen完成全部19项Agent任务且18项一次通过,EngramHalo IQ4完成16项。哔哩哔哩

实境口径(知乎"怂中求稳"395主机作业,用的不是官方配套量化,是自己下载好的Qwen3.8-Flash-Next-UD-IQ4_XS,Docker部署,端口8731、兼容OpenAI协议):

  • 整个太阳系动态网页任务,harness显示整个任务平均输出速度为32 t/s。知乎

  • 单条请求速度巅峰在 Req 7:生成速度飙到了 48.58 t/s,MTP 投机头每轮能命中 3.14 个词。

  • 有一条请求为了生成太阳系网页,模型连续不断地输出了 2 万多个 Token,将近 11 分钟没停过,速度稳稳钉在了 30.75 t/s。

  • 最后一条请求上下文堆到57,809个token,其中57,255命中缓存,prefill只花1.80秒。

评论区口径:有人报"llama优化了:不少最多到25这样",UP主回"在我的任务中50+“,另有自测者补了一句"提升不少,且不衰减”。也就是说,"翻倍"的说法有依据,但依据是个人任务场景,不是统一bench。哔哩哔哩

为什么能快?拆开是三个机制:学习式N-gram嵌入(这是Qwen3.8-Flash-Next模型架构自带的特性)、MTP多token预测投机解码、KV Cache原地复用。注意,这不是"驱动更新"式的优化,而是模型和引擎的联合设计——引擎是跟着新一代模型的N-gram/MTP结构做出来的,通用路线接不住,很正常。这也解释了为什么llama.cpp追上它要靠"写补丁",而不是换个编译选项。

一句提醒:横评比的是"引擎+量化"的完整配置组合,并非所有速度测过的配置都做了任务评估。那组19题、18题一次过的成绩,评测用的是Terminus-2、单题3小时上限、失败允许重试一次。完整原始数据在local-llm-benchmarks.dev和kyuz0.github.io/terminal-bench-mini,想复核的可以直接去看。{{{CUSTOM_HTML_TAG_5}}}

第二本账:"白捡"的另一面,是四个绕不开的坑

  1. 环境门槛:作业环境是Ubuntu Server 24.04 + ROCm 7.1.1 + Docker,官方只提供镜像。评论区"Windows用docker desktop也能跑"和"Win难搞得要死"两派还在打架——家用Windows党先别热情。

  2. 划拨和墙:主机仅划拨 4GB VGM(显存),留出 120GB GTT(共享内存),再用RyzenAdj设置了75w功耗墙和75℃温度墙。模型量化文件本身100+GB,是评论区问答里报的数。有装机者直接遇到"Memory access fault by GPU node-1",两天后才确认是Ubuntu firmware问题、升级解决——bench视频不会告诉你GPU报错其实是固件的事。知乎哔哩哔哩

  3. 版本风暴:用户原话"这玩意更新频率巨快,刚刚都 0.11 了,我目前用的是 0.10.1",还补了一句"所以我寻思也不急,攒着版本再说"。Docker部署升级回滚方便是遮羞布,对"定时任务不能挂"的用户就是实打实的运维负担。

  4. 模型选择:官方HF仓库peonist-ai/halogen-qwen3.8-flash-next带定制w4b.hgn量化,但这位395车主用的是之前就下载好的 Qwen3.8-Flash-Next-UD-IQ4_XS。不必吃他家量化,但速度得自己重测一遍。

第三本账:谁今天动手,谁等补丁,谁看戏

建议今天就装的:已有395/128GB Strix Halo主机、在Linux上跑定时任务、长文生成、Agent工作流的人。这波收益最贴的场景就是"每次读一大段上下文再跑长任务"——prefill和KV复用吃的正是这两头,5.7万token 1.8秒这种数,在llama.cpp上还是几天前不敢想的。

建议再等的:开源栈洁癖党和插件生态用户。titan909在评论区说现在有开发者再给llama.cpp写补丁希望能追上halogen,这样就有开源选项了。与其现在迁到一家日更引擎,不如等几周看开源选项的价格;Windows党和容不得版本抖动的也一起等。哔哩哔哩

不关你事的:小显存独显玩家。评论区有人拿3060 12G+64G内存去问,得到的回答是能、上下文短、不能256k,走的还是第三方FreeToken路线。Halogen吃到的是统一内存阵营。至于手里是9070GRE 12G+9060XT 16G拼28GB双卡的用户,9月17日晚B站刚有人放出ROCm 10 + RCCL双卡并行的编译作业,kernel换到Linux 7.2.6-x64v3-xanmod1(这个会让prefill快一些)。那是另一条战场。哔哩哔哩哔哩哔哩

还在犹豫要不要上车395的:这轮给你添了个新变量——机器买的其实是128GB统一内存的带宽,而引擎进度正在以周为单位把带宽换成速度,评论区甚至已经在拿"50+"和Mac阵营omlx的40-50t对线。但反过来说,今天的速度函数只属于今天这个版本,模型对内存的需求只会越来越大。唯一不建议的选项,倒是跟以前一样:为了"现在跑分还不够快"去等硬件降价。

观察信号(可收藏)

  • llama.cpp侧补丁进度:开源栈多久能给出"等效速度";

  • Halogen从0.11往后是否收敛,会不会放出Windows/原生的官方部署;

  • Terminal Bench Mini后续成绩:其他引擎补齐评估后,18/19的通过率还站不站得住;

  • 官方w4b.hgn满血量化放出的速度变化。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章