9月4日,NVIDIA在IFA 2026上开源了Personal AI Router(PAIR)。消息传了两天,攒机圈评论区基本是同一个剧本:“显存池化来了”“三台旧机并联跑100B”“两张4090顶一张5090”。
结果搬运自Cloud Codes的拆解视频把话挑明了:官方文档在五个不同位置,否认了跨机模型切分、张量切分和显存池化这整套想象。哔哩哔哩
PAIR不合并显存,它是个并发负载均衡器:把你局域网里几台跑着Ollama、LM Studio的机器接起来,按GPU压力派活,总吞吐上去了,但单卡显存上限一字节都没多。用官方自己的话说,它会自动发现本地网络里的兼容PC,把相互独立的推理请求路由到还有算力的那台机器上。微博
偏偏就在这一周,本地推理圈密集出牌:IFA上宣布的RTX Spark Windows整机,定档10月上市。知乎苹果M5 Ultra版Mac Studio刚开卖,DeepSeek V4.1 Flash也在9月8日于官方群悄悄开测。第一财经于是最实际的问题又摆上台面:预算到底花在哪——换显卡、加内存、买128GB迷你主机,还是再等六周?
这篇是给已经装过Ollama或LM Studio、至少分得清量化档位、正琢磨把27B到120B级模型跑在自己桌子上的那批人写的。本地推理一共四笔账:容量、带宽、软件栈、并发。这一周各家放出来的实测数字,我们放在一起对个总账。

第一笔·容量账:只回答“装不装得下”
容量账很朴素:模型总参数×每参数比特数,加上KV cache占的那一口,塞不塞得进显存或统一内存。5090的32GB是这一代消费卡天花板,跑27B级稠密模型的量化版绰绰有余;但OpenAI那款117B参数的gpt-oss-120b,消费级单卡物理上装不进去。The Stack实测的GMKtec EVO-X2,凭128GB统一内存池把它装了起来。哔哩哔哩
同一台机器的另一组数字同样重要:装Llama 70B这种稠密模型,生成速度只有2.7 token/s,一分钟打出一篇日记。作者的总结很直白——32GB以内5090轻松碾压,过了容量墙迷你主机才有出场资格,而且只配MoE模型:gpt-oss-120b跑在这台机器上能干活,是因为它每个token只唤醒51亿参数。哔哩哔哩

这里埋着一个新坑:MoVA这类稀疏架构。K2 Horizon号称4B激活参数在Agent任务上跑赢550B,实测显存照样要吃75GB——稀疏不等于小模型,3000个专家矩阵全量驻留显存,官方审计后还把基准分从70.2%主动下调到了66.9%。哔哩哔哩
“激活量”骗得过带宽,“参数量”骗不过容量。省显存的另一条路是把模型本身做小:Empero AI的Ridge微调版把Qwen3.8-27B塞进了16GB显存,还留得出上下文空间。哔哩哔哩小红书上有16G显存流畅干活的Qwen3.8-27B社区量化版(Zerodigest团队出品)。小红书
至于厂商话术,过一遍容量账再信:极摩客官方视频的卖点是126TOPS算力加“LMStudio性能超RTX4090 2.2倍”——TOPS是算力口径,解码瓶颈在带宽,这两个数字根本不该放进同一张对比表。哔哩哔哩另外,这台被点名最多的128GB小主机,半年里价格已经涨了六成,窗口期这个东西是双向的。哔哩哔哩
第二笔·带宽账:回答“吐字快不快”
知乎上近期流传的那条“推理速度完整逻辑链”把事推得很干净:预填充是计算受限,一次吃掉整段输入,张量核满负荷;解码是内存受限,每生成一个token都要把全部权重搬一遍,算力再富余也快不过这条搬运线。知乎
所以看本地硬件,带宽比跑分诚实。知乎RTX Spark话题下的高赞实测给了最扎心的对照组:5090带宽1.8TB/s,Qwen3.8-27B跑到101 token/s;DGX Spark带宽约300GB/s,同一个模型只有13 token/s——“能跑得起来,想干活几乎不可能”。知乎
B站另一组5090实测补了长上下文的细节:NVFP4版Qwen3.8-27B跑vLLM单并发,8K上下文78.98→84.39 tok/s,拉到128K仍有66.73→70.53。哔哩哔哩苹果走的也是带宽路线:Mac mini M4 Pro(48GB)用oMLX跑Ortin 1.5 35B-A3B,实测能到80+ token/s。小红书
这条逻辑链还解释了一个吓到不少人的数字:为什么2K上下文能跑57 token/s,32K上下文却跌到0.22 token/s?知乎0.22对应每秒0.33个字,是阅读速度的二十四分之一——但云端产品用批处理、推测解码和旗舰吞吐(实测400 token/s级别)把这层尴尬摊平了。本地裸机没有这层工程缓冲,长上下文的带宽账,全得自己消化。这也是为什么同样的“27B”,在5090上是生产力,在300GB/s带宽的机器上是态度问题。
第三笔·软件栈账:你的模型可能不是“你选的那个”
这一周B站本地区最扎心的一期叫《本地大模型变笨了?》:Ollama和LM Studio经常自动替你挑量化文件,同样的“Q4”不是一回事——Q4_K_M和Q4_K_XL不等价,GPTQ和AWQ在同比特下表现差异显著。哔哩哔哩
更阴的杀手是KV cache精度:4-bit缓存可以直接导致Agent工具调用失败,长上下文检索损失最高23%。哔哩哔哩甚至只换vLLM的注意力内核,输出就会变——推理引擎本身在改模型的“脾气”。这期给的解法很实用:五分钟自测,拿相邻量化档位在真实任务上对跑,先定位问题出在量化还是模型,并把完整运行环境记录在案。
引擎层上周还有一出反转剧。Perplexity开源的Rust手写引擎Lily,专跑Qwen3.6-35B-A3B的4-bit档,英文报道统一口径“比MLX快1.23/1.35倍”;第二天官方仓库放出第二份报告,同一台M5 Max上,预填充均值从1.238倍掉到1.032倍,基本打平,131K上下文档反而慢两成。哔哩哔哩原因不用猜:MLX自己把预填充提升了20.55%,Lily纹丝没动。一个为单一模型手写引擎的护城河,宽度等于对手的一个小版本号。
报道基本没提的另一个门槛不是内存,是芯片代次:Lily要求M5起步、macOS 26起步,M1到M4插多少内存都没用。哔哩哔哩
M5 Ultra本尊也挂在这笔账上:Kai的拆解指出,新芯片的张量核心主要加速预填充,逐字解码依旧被内存带宽卡住;LM Studio里的llama.cpp默认关闭张量API,目前只有MLX和BaseRT能吃得到加速——后者对前者有6.4倍的提升,同样是厂商口径。哔哩哔哩

所以那句“史上最好本地AI硬件”,建议听后半句:别首发,等10月底512GB版本定价和更长上下文的独立实测;截至9月6日,还没有人对M5 Ultra做过独立测量。哔哩哔哩除非模型已经适配,或者你的数据不能出本机,当天买的理由才成立。
第四笔·并发账:PAIR真正给的东西
绕回开头。把误解剥掉之后,PAIR的价值反而清楚了:它解决的不是“单机跑不跑得起大模型”,而是“几台机器一起干活时,谁在等谁”。机制上,它接管各台机器上Ollama/LM Studio的端口,用双向TLS加六位PIN组网,按40%/70%/85%的GPU压力阈值给机器排名、派任务,避免请求全砸在同一台机器上。哔哩哔哩
IFA演示里“18分钟智能体任务压到8分48秒”那个数字,靠的是多智能体并发再加一台5090,不是显存融合。哔哩哔哩
这恰好对上国内社区正在长的那类需求:知乎上“没有NVIDIA,怎么让二十来同事用上本地大模型”的落地复盘,就是一台128GB统一内存的AIMAX+395划出64GB当显存,全组共用。知乎小团队共享本地推理是个多机问题,不是单机堆显存问题;以前拿llama.cpp的RPC切层凑合,又脆又不安全,PAIR等于官方把这个玩法做成了带认证、带调度的路由器。

对号入座:这四笔账怎么花
只有16-24GB旧卡:别急着升级。先跑五分钟量化自测,再试Ridge、Cold-Fusion这类社区调教版,27B级别的活现在16GB就能干,省下的预算是纯的。
单卡预算、要快:5090仍是带宽王,27B稠密101 token/s,量化版长上下文8K/128K都在70-84 tok/s区间,干活体感最好。
要摸100B+、预算有限:128GB Strix Halo迷你主机可以上,但只配MoE路线,注意它半年涨六成的价格,以及宣传口径里算力/带宽的偷换。
Mac阵营:M5 Ultra按上面的建议等10月底;手上已有M4大内存机器的,MoE小激活路线现在就能吃到80+ tok/s,不用换机。
好几台旧机器/小团队:PAIR免费开源(Apache-2.0),这是它唯一的正确打开方式,别指望它救单卡显存。
盯上DGX Spark/RTX Spark:前者13 token/s的社区口径基本判了“干活”死刑;后者10月上市,等第一波独立带宽实测再决定。
接下来盯什么
10月两件事会重新洗牌:RTX Spark Windows整机的第一批实测,和M5 Ultra 512GB版本的定价——“等六周”这个赌注就压在这上面。DeepSeek V4.1 Flash内测的官方口径是能力更强、速度更快、且成本更低,如果后续放出开源权重,MoE小激活路线的容量账还得再算一遍。以及,PAIR的官方文档值得自己再刷一遍——这次全网读错它,下次未必。
数字口径提醒:本文所有token/s来自各视频UP主自测与翻译搬运,量化格式、上下文长度、并发数互不相同,只能当量级参照,不能跨条目横向排名。这恰恰是本地社区最缺的东西:同一台机器、同一份测试脚本的公共基准。在那之前,谁晒“我的机器比你快”,先问一句——你的Q4,是哪种Q4?