昨天(10月10日)早上七点,B站一个粉丝只有31个的UP主发了条四分钟的视频,本地部署圈子一整天都在发酵。
他用两张二手Tesla V100-32G(无NVLink),配X99双路主板和62G内存,跑一个1760亿参数的MoE开源模型社区去审查改版(IQ3_S量化,文件82.8GB,256K上下文),解码中位172 tok/s,峰值190.3。参照口径他交代得很清楚:同模型、同量化、同引擎家族下,Strata社区公开基准里RTX 4090单卡97.2、RTX 5090单卡170.5。六千出头的二手卡,追平了四万多的旗舰,数字对得上。哔哩哔哩

但视频下面一百多条评论,没有人在排队买卡。点赞最高的一条忙着报价:32G版本涨到4000了,这价格都能买4张16G版本的,太魔幻。紧接着是DDR4主板也涨价了,以及UP主自己说内存也涨价——3年前他120块钱买了4条16G的服务器内存条,上个星期再买同样的4条,一条就要120。哔哩哔哩
一条实测视频带火了老卡,老卡当场就不便宜了。今天把三组数字对完再决定要不要进场:172 tok/s在什么条件下成立、价格已经涨到哪了、这条路线到底适合谁。
九年前的卡,凭什么追平5090
V100是2017年的卡,Volta架构,计算单元SM70——这一代在新版推理内核里基本属于被放弃的对象。它能追平新旗舰,靠的不是算力,视频里给的答案很直白:权重全驻留。哔哩哔哩
他跑的是MoE模型,推理时每次只激活一部分"专家"权重,瓶颈不在峰值算力,而在专家能不能随叫随到。4090/5090单卡只装得下约一半专家(约12000个槽位,命中率92%-97%),命不中的要走系统内存甚至硬盘;两张V100合计64G显存,24576个专家槽100%驻留,推理全程不落盘。MoE拼的是显存容量,不是TFLOPS。哔哩哔哩
这不是孤例,是这一周圈子里的共识在成形。上周一条6.5万播放的无恰饭实测视频结论相同:显存在AI大模型里的权重很高,内存也很关键,算力并非最最最重要的——当然如果玩游戏,还是算力主导。那位UP主下一期就准备测低端双卡能不能逆袭旗舰单卡。微博上10月7日也有人发"丐版本地大模型推理服务器搭建指南",主角同样是两张老V100。MIT开源的Project Maya走得更远:两张老V100加30G内存跑起全模态模型,官方模型卡标称生成40 tok/s、读prompt 440 tok/s,办法是把专家在显存、内存、固态硬盘之间分层搬运,引擎同样构建在开源推理项目Strata之上,只支持Linux。哔哩哔哩微博哔哩哔哩
软件对老卡的解锁有多猛?小红书上一条独立的双V100实测(《两张二手老卡,跑平4090》)给了量化答案:刚跑起来时,长上下文只有36字/秒,第一个字要等七分半;重写attention内核之后,单卡涨到56;再插上第二张卡,到101.9——双卡是单卡的1.8倍。还有一条《V100二手卡,有人喊4500》的笔记把时间线拉得更长:专攻老架构的开源分支,今年3月23日跑通122B模型,8月31日把27B量化峰值推到280 token/秒,10月4日双卡版本峰值236。硬件没变,能跑的东西变了。小红书小红书

一句话:2026年本地大模型的游戏规则,正在从"比算力"变成"比显存容量"。这是老卡翻身的全部合法性——数据中心退役卡恰好最多的是什么?大显存,而且曾经很便宜。有拆机V100 32G的玩家说得直接:16G只能算入门玩具,32G才算真正起点。注意"曾经"两个字。小红书
172 tok/s有几成水:把口径摊开对
作者自己在视频简介和评论区披露了多套数字,替他整理在一起:
口径 | 数字 | 说明 |
|---|---|---|
峰值 | 190.3 tok/s | 标题里那个 |
中位 | 172 tok/s | 同配置6轮取中位 |
日常体感 | 78-93 tok/s | 知识问答、开思考模式 |
长上下文 | 1K时106.0 → 256K时87.4 tok/s | 顶格只掉18%,比预期好 |
首字延迟 | 256K上下文TTFT 148.6秒 | prefill按1756 tok/s全量吃一遍 |
单卡V100 | 33.5 tok/s | 社区同款基线;官方参考值38-51 |
三个要点:
第一,"追平5090"有一长串前缀。双卡、176B MoE、IQ3_S量化、Strata引擎、社区Volta专用内核(要手动开STRATA_EXPERIMENTAL_SM60=1这类实验开关),再加锁频1380MHz、关ECC、layer-split 24对半分层等一堆参数,缺一个数字都会大变。单卡V100只有33.5 tok/s,不到峰值的五分之一。别把"双卡满调优+MoE专家全驻留"的成绩,误当成"V100"这个型号的成绩。评论区有位玩家贴的自测口径(200K上下文,测试条件未说明,仅作旁证):4090D 24G生成约90 tok/s、V100单卡32G约60、MI50单卡32G只有37——比V100更便宜的MI50,是用速度换的钱。哔哩哔哩
第二,真正的瓶颈不是吐字,是首字。256K上下文TTFT要等148.6秒。长文档、长合同场景,每轮对话开头干等两分半,这个体验折扣比tok/s大得多。作者自己在评论区也承认,真正该担心的不是decode,是首字延迟。哔哩哔哩
第三,口径有打架的地方。视频简介写MTP投机解码接受率98.6%,作者在评论区回复长上下文质疑时又说接受率恒定83%。两个数差了十几个点,没有解释哪个是什么口径。不影响大局,但拿这条视频当采购依据的人,应该知道它的粗糙度。另外要说明:UP主标注了配音和演示动画由AI辅助生成、实测数据来自本机日志,还主动写"评论区欢迎对线,我贴原始数据"——口径自觉比多数带货视频强,但31个粉丝、单机实测、暂无第三方复现,它现在是一份值得关注的个体样本,不是一份采购报告。哔哩哔哩
前面提到的那条小红书双V100实测,恰好能做交叉验证,而且把"口径"两个字演得更透:256K上下文代码生成,双V100跑到94.7字/秒,对手魔改4090 48G是80.9,上下文越长老卡优势越大;质量也没掉——300道题双V100答对237,4090答对236,只差一道。但首字等待完全反过来:同样256K,4090等210秒,双V100要等393秒,慢1.85倍,作者的原话是这一步卡在算力,软件补不了。堆卡堆得回吞吐,堆不回预填充——两份独立实测在这一点上口径一致。小红书

还有个天花板要知道:评论区提到Strata目前最高只支持IQ3_S。这套双卡64G显存里,模型专家层IQ3约占52GB刚好放下,想上IQ4(约67GB)就得加第三张卡,溢出到内存速度立刻掉下来。显存封顶,模型质量也跟着封顶——买卡前想清楚IQ3够不够用。哔哩哔哩
价格先跑了:捡垃圾的窗口正在关闭
这是当下最值得写的部分,因为它正在实时发生。
为什么涨?《V100二手卡,有人喊4500》那条笔记给的判断比行情更有意思:V100涨价的原因跟别的卡不一样——不是硬件变了,是软件变了。上一节那条开源分支的跑分曲线,就是它的涨价曲线。但同一位作者顺手泼了盆冷水:280的峰值是跑分口径,后来实测的人在评论区交了底——写代码平均190,短上下文140,180K长上下文100,换一套不做张量并行的跑法,直接掉到30左右,同一张卡能差出近8倍。“跑分值不等于你手上的日常值”,这句话建议在付款前读三遍。小红书

涨价的节奏,放在一条时间线上看更刺激:两个月前,二手V100 32G还是千百来块;10月5日有人在小红书发帖"大概3000一张",当天评论区就冒出两个新价——3800、4500;10月10日B站那条视频还在按"双卡六千出头"报账,当天评论区32G单卡已喊到4000元。往上游追,涨的不止它:笔记作者提到8月中华强北显卡全面封仓、普涨三到四成,DDR4内存套条跟涨,二手3090已经破万。MI50 32G"本来最有性价比的,结果涨价了";配套的DDR4主板在涨,服务器内存按那位UP主亲历是4倍。小红书哔哩哔哩
照4000元一张重新估:卡8000,加上同样在涨的X99双路主板、64G DDR4内存、大功率电源和服务器卡散热改造,整机奔着万元去了。差价从7倍缩到3-4倍——还便宜,但"魔幻性价比"没了,剩下的每一分便宜,都要用SM70社区内核、IQ3_S量化上限、148.6秒首字和功耗去换(一位4卡V100用户在评论区形容:“待机功耗惊人(load模型后)”)。哔哩哔哩
这不是V100一家在涨,是大盘在挤压。把微博上这几个月的信号排一排:三大存储厂把七成以上产能给了AI服务器,消费级内存被严重挤压,DDR5部分规格比一年前贵近5倍,“短期内看不到头,新晶圆厂从建到投产至少两三年”。7月底华强北出现"显卡一天大涨1000元"的报道,5月就有#英伟达显卡涨价300%#的热议。8月初科创板日报报道,连租赁商都开始拆售显卡和内存。还有行业观察帖直说,算力现在很短缺,老早的V100和A100都在用。微博微博微博
传导链条清清楚楚:新卡新内存太贵 → 需求外溢到二手大显存老卡 → 老卡跟着涨。6.5万播放那条视频的UP主有句话点破了上一轮:要不然也不会有这么多48G的4090出现!魔改48G 4090就是被这套逻辑先炒起来的,现在轮到V100和MI50。哔哩哔哩
省钱的另一头也在变。UP主"老T拆AI"前天算过三本账:二手3090按8033元、3年折旧,每月约223元,而Claude Pro订阅每月约135元;要跟按量API打平,对标DeepSeek最便宜档,每月得生成近6000万输出token。云端还在打价格战:有对比表显示Haiku 5.5输入每百万token十美分、DeepSeek 4.1 Flash高峰三十美分闲时半价、GLM 5.3 Flash十五美分。那条V100视频的评论区里,云租商已经闻着味进场了:4090按小时租一块多,用完就释放。哔哩哔哩哔哩哔哩哔哩哔哩
所以"六千块追平5090"这个故事,两头都在失效:硬件端入场费在涨,收益端云租和API价格在被摁着打。捡垃圾依然有价值,但价值回归到了"要算账"三个字。
这条路线到底适合谁
适合的三类人:
跑百亿级以上MoE模型的:专家层IQ3约52GB,双V100的64G刚好全驻留,这仍是市面上最便宜的"64G显存"方案。你要跑的就是这类模型,且接受IQ3量化质量,这条路为你而修。
有并发批处理需求的:作者的说法是显存够时开8并发效率最高,单路速度降下来,但总token数直接翻4倍。小工作室做批量摘要、打标、离线任务,按万元整机摊三年,比按小时租卡便宜得多。哔哩哔哩
折腾党:置顶评论有完整参数清单(layer-split 24、mtp-hnorm stream、spec-min-p 0.80、kv k8v4等)和避坑提示——别开mtp-q4/coupled-draft、记得清僵尸进程否则速度暴跌。文档完整度在小UP主里算罕见的。
不适合的三类人:
跑27B/32B稠密模型的:V100的大显存优势用不上,纯属花钱买罪受。看"老显卡实验室"的2080Ti系列更实在:两张2080Ti上NVLink桥,带宽16→25.78GB/s,decode从39提到53 tok/s,上下文从64K开到128K;单卡22G路线只有GGUF活得最好。稠密中小模型,2080Ti/3090方案均衡得多。哔哩哔哩
长文档首字敏感的:148.6秒TTFT摆在那,重度读论文、审合同的人,要么等Maya那类分层预填方案成熟,要么直接租新卡。
想开箱即用的:官方引擎对SM70的支持在退化,社区分支要自己编译自己维护,这个门槛真实存在,而且社区分支断更的风险没人担保。
“折腾"两个字具体多重?两条一线记录供参考。有人去年底3600元装完整台双V100主机,gpu-burn烤机两小时57°C,fp16训练"比租的4090快一点”,但坑单一串:主板BIOS必须打开Above 4G decoding否则点不亮、显卡负载波动时啸叫、忘买亮机卡白等好几天、机箱孔位对不上。另一位第一次上V100的更惨:这卡占3.5个PCIe槽位,第二张卡插不进去,只能用延长线外挂在机箱外,盖子翘着用了一个月。这些才是"拆机卡真香"背后的日常。小红书小红书

最后给两个观察信号,比"买不买"更值得盯:一是V100/MI50的报价走势——32G如果普遍站稳4000元,这波捡垃圾行情基本可以宣告结束,别追高接盘;二是Strata官方何时收编Volta内核——官方支持SM70,老卡还有一波价值重估;一直靠社区实验分支,风险就一直在。那位UP主说下期用同样路子调GLM 5.3,值得标记追更,看第三方能不能复现172。哔哩哔哩
一句话总结:这条视频真正证明的不是"二手卡便宜",而是"显存是本地AI的新硬通货"。而在硬通货一天一个价的市场里,最贵的从来不是卡,是在高点进场。