四个人同时用一个本地大模型,速度从44掉到17 token/s:团队部署前,先搞懂“总速度”守恒

源自41位全网作者

04:46

这波 DeepSeek 涨价之后,本地部署圈子里出现了一个很现实的变化:以前是个人玩家算自己的 token 账单,现在开始有团队算整队的账单了。

逻辑不复杂。一个人用,涨价后一个月也就多出几十块,忍忍就过去了;但一个三五人的小队一起用,一天烧掉几百万 token 很正常,涨价直接放大成成本问题,再叠加一句"数据不出域","买台机器放公司,跑开源模型"这个选项就显得特别眉清目秀。

但我发现,大部分团队部署帖都停在"装好 Ollama、跑起来、截图撒花"这一步,很少有人回答后面那个更要命的问题:一台机器跑模型没问题,但它到底能供几个人同时用?

前几天 B 站有个实测正好把这事儿测透了,结论相当反直觉,值得每个准备给团队部署本地 AI 的人先看一眼。

四个人同时用一个本地大模型,速度从44掉到17 token/s:团队部署前,先搞懂“总速度”守恒

四个人同时用一个模型,会发生什么

UP 主的测试机就是一台标准家用 PC:i7-14700KF + RTX 5070 Ti 16G + 32G 内存,跑的是 MoE 结构的 Qwen3.6-35B-A3B(总参数 35B,每次推理只激活约 3B)。哔哩哔哩他自己做了个并发测试页,让 1 到 4 个人同时对话,实测输出速度是这样的:

  • 1 个人:约 44 token/s,快到读不过来

  • 2 个人:每人约 28

  • 3 个人:每人约 20

  • 4 个人:每人约 17

注意看规律:人越多,人均速度越慢,但四个人的总吞吐始终恒定在 44 token/s 左右哔哩哔哩也就是说,加人不会让机器"更努力地干活",它只是在把同一份总速度切得更碎。

这个结论跟很多人的直觉相反。大部分人以为并发慢是因为"GPU 算不过来",但实际上这类场景里 GPU 利用率可能连三成都不到——真正卡脖子的是内存带宽:给芯片喂数据的那条路,只有一条车道。

为什么是内存带宽,不是算力

这和本地推理的工作方式有关。大模型生成文字时是逐 token 往外蹦的,每生成 1 个 token,都得把模型权重从显存(或内存)里完整"读一遍"。所以生成阶段的速度大致等于:

每秒 token 数 ≈ 内存带宽 ÷ 每个 token 要读的字节数

GPU 的算力在这个阶段其实是过剩的,它大部分时间在等数据从显存搬过来。就像一条单车道高速公路,你往上面塞 1 辆车还是 4 辆车,总车流量不会变,只能人均分摊。哔哩哔哩这个实测里还有个更有意思的细节:UP 主用的是"MoE 专家全放 CPU、GPU 只算注意力"的部署方式(llama.cpp 的 MoE offload 玩法,老显卡圈最近很流行,有人用 6GB 显存的 GTX 1060 把同款 35B 模型跑到了 17 token/s)。这时候瓶颈就从显卡显存变成了 CPU 侧的内存带宽——双通道 DDR5 的理论带宽大概 90GB/s 上下,3B 激活参数按 Q4 量化折算每个 token 要读 2GB 左右,理论上限算下来正好是 45 token/s 上下,和实测"总吞吐 44"几乎严丝合缝。

所以不管你是单卡全量跑,还是 MoE 卸载到 CPU,结论都一样:一台机器的总输出速度,在你选定硬件和模型的那一刻就基本锁死了,加人只是稀释,不是扩容。

第二堵墙:就算带宽够,显存也不一定答应

带宽决定"总速度",显存决定"能不能坐得下这么多人"。很多人开并发时翻车,翻在第二个上。

先说个容易被忽略的事实:Ollama 默认配置下,同时只处理 1 个请求(OLLAMA_NUM_PARALLEL 默认值就是 1)。知乎第二个人的问题要排队等第一个人生成完才开始——这就是为什么有人把 Ollama 分享给朋友后,第三个人等了两分钟才看到第一个字。问题往往不是机器不行,而是并发压根没开。

开了之后,显存账是这么算的:

所需显存 ≈ 模型权重 + 每个并发会话的 KV 缓存 × 并发数

模型权重是固定的,但每个人对话越长,KV 缓存涨得越凶。知乎有篇 Ollama 并发配置的文章给过一个具体例子:RTX 3090 24GB 跑 qwen3:14b,按这个公式算下来最大并发是 2;换 q4_K_M 量化版能挤到 3 个。知乎24GB 的卡也就这个水平,16GB 的卡就更得精打细算了。

按人数选方案:一张决策表

四个人同时用一个本地大模型,速度从44掉到17 token/s:团队部署前,先搞懂“总速度”守恒

把带宽和显存这两堵墙合起来,给团队部署的选型其实就很清楚了:

1-2 人用:Ollama 默认配置加个 Open WebUI 就够了,排队也排不出感知,别折腾。

3-5 人用:把 OLLAMA_NUM_PARALLEL 开到 2-4(按上面的显存公式算,别拍脑袋),同时记得在 Open WebUI 后台做限流——给每个人设并发槽位上限,比如一人最多占 2 个槽,防止一个人连发几个长任务把全队卡死。模型尽量选 MoE 结构(Qwen3.6-35B-A3B 这类),小激活参数对并发场景更友好。

5-10 人用:该换引擎了。Ollama 的定位是个人工具,社区的技术拆解结论很直接:低并发时 Ollama 和 vLLM 速度几乎一样,但并发上来之后 Ollama 的请求阻塞会让首字延迟指数级恶化,而 vLLM 靠 PagedAttention 解决 KV 缓存的显存碎片问题,再用连续批处理让请求随到随上车,才是为多用户场景设计的。知乎如果不想换引擎,也可以多开几个 Ollama 实例,前面挂 Nginx 做 least_conn 负载均衡——能用,但属于缝缝补补。

10 人以上、或者对响应有硬性要求:认真说一句,别硬上本地了,算算 API 的账。DeepSeek 这波确实涨了,但涨完对海外顶级模型仍有明显价格优势。知乎预算紧的还有 MiniMax M3 这种 49 元/月、每月约 6 亿 token 的档位。知乎本地部署的价值在数据不出域和长期成本,不在"任何规模下都比云便宜"。

再泼一盆冷水:现在装机,正好撞上涨价潮

既然是值得买,就得聊聊钱。现在这个时间点给团队装机,不太巧——正赶上显卡涨价潮。8 月中旬知乎装机帖里的实时行情:技嘉 5070 Ti 魔鹰天猫卖到 10627 元。知乎RTX 5070 涨到 6500 元上下,RTX 5080 逼近 12000 元,连 5060 Ti 16G 都要 5500 元往上,整体涨幅三成左右,华强北都"一天一个价"了。知乎红队这边 9070 XT 16G 只要 5999 元,是 16GB 显存档位里难得的便宜选择(但注意本地推理生态 N 卡更省心)。

四个人同时用一个本地大模型,速度从44掉到17 token/s:团队部署前,先搞懂“总速度”守恒

所以给个简单的判断标准:先估一下你们团队现在每月的 token 账单。如果一个月也就一两百块,纯为省钱去买一台七八千的机器,大概率回不了本——本地部署真正划算的场景,是"高强度使用 + 数据敏感"两条至少占一条。机器买回来还有电费、维护、模型更新的隐性成本,别只盯着"一次性投入"。

三个部署前的避坑提醒

  1. 别光开并发不看显存。num_parallel 拉上去之前先按公式算一遍,长对话场景 KV 缓存很能吃,OOM 崩给大家看是小事,把队里人的对话记录崩没了是大事。

  2. CPU offload 不是免费午餐。MoE 专家丢到 CPU 确实能让小显存卡跑大模型,但总速度会被内存带宽锁死(就是前面那个 44 token/s 的来源),对"单人够用、多人排队"的场景要有心理预期。

  3. 给团队开访问,走内网穿透别裸奔。实测视频里 UP 主用的是 WireGuard 组异地局域网,人在外面也能连家里的大模型——这是正确姿势。哔哩哔哩直接把 Ollama 端口暴露公网的,等于把自家模型和对话记录挂出去展览。

接下来值得盯什么

短期内可以关注三个信号:一是 DeepSeek 后续的定价动作(涨价后社区已经有明显分流,各家都在抢这波溢出的用户);二是显卡价格的走势,AI 需求和产能的博弈还在继续,刚需装机可以蹲大促;三是新开源模型的显存需求——比如刚出的 Qwen3.8-27B,社区实测 16GB 卡跑量化版可行,对团队部署来说是个不错的并发候选。

最后说回开头那个问题:本地 AI 供一个团队用,完全可以,但它不是"多个人就多份力",而是"一条车道大家轮流走"。想清楚你们队里是 2 个人还是 8 个人,是偶尔用还是全天烧 token,再决定是改两行配置、换个引擎,还是干脆把预算交还给 API。这笔账算明白了,部署这件事就成了一半。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章