两张二手V100「追平5090」,数字是真的,价格已经不是了:32G单卡被喊到4000元、服务器内存翻4倍——捡九年前的卡之前,先弄清172 tok/s在什么条件下成立

源自226位全网作者

08:47

昨天(10月10日)早上七点,B站一个粉丝只有31个的UP主发了条四分钟的视频,本地部署圈子一整天都在发酵。

他用两张二手Tesla V100-32G(无NVLink),配X99双路主板和62G内存,跑一个1760亿参数的MoE开源模型社区去审查改版(IQ3_S量化,文件82.8GB,256K上下文),解码中位172 tok/s,峰值190.3。参照口径他交代得很清楚:同模型、同量化、同引擎家族下,Strata社区公开基准里RTX 4090单卡97.2、RTX 5090单卡170.5。六千出头的二手卡,追平了四万多的旗舰,数字对得上。哔哩哔哩

两张二手V100「追平5090」,数字是真的,价格已经不是了:32G单卡被喊到4000元、服务器内存翻4倍——捡九年前的卡之前,先弄清172 tok/s在什么条件下成立

但视频下面一百多条评论,没有人在排队买卡。点赞最高的一条忙着报价:32G版本涨到4000了,这价格都能买4张16G版本的,太魔幻。紧接着是DDR4主板也涨价了,以及UP主自己说内存也涨价——3年前他120块钱买了4条16G的服务器内存条,上个星期再买同样的4条,一条就要120。哔哩哔哩

一条实测视频带火了老卡,老卡当场就不便宜了。今天把三组数字对完再决定要不要进场:172 tok/s在什么条件下成立、价格已经涨到哪了、这条路线到底适合谁。

九年前的卡,凭什么追平5090

V100是2017年的卡,Volta架构,计算单元SM70——这一代在新版推理内核里基本属于被放弃的对象。它能追平新旗舰,靠的不是算力,视频里给的答案很直白:权重全驻留。哔哩哔哩

他跑的是MoE模型,推理时每次只激活一部分"专家"权重,瓶颈不在峰值算力,而在专家能不能随叫随到。4090/5090单卡只装得下约一半专家(约12000个槽位,命中率92%-97%),命不中的要走系统内存甚至硬盘;两张V100合计64G显存,24576个专家槽100%驻留,推理全程不落盘。MoE拼的是显存容量,不是TFLOPS。哔哩哔哩

这不是孤例,是这一周圈子里的共识在成形。上周一条6.5万播放的无恰饭实测视频结论相同:显存在AI大模型里的权重很高,内存也很关键,算力并非最最最重要的——当然如果玩游戏,还是算力主导。那位UP主下一期就准备测低端双卡能不能逆袭旗舰单卡。微博上10月7日也有人发"丐版本地大模型推理服务器搭建指南",主角同样是两张老V100。MIT开源的Project Maya走得更远:两张老V100加30G内存跑起全模态模型,官方模型卡标称生成40 tok/s、读prompt 440 tok/s,办法是把专家在显存、内存、固态硬盘之间分层搬运,引擎同样构建在开源推理项目Strata之上,只支持Linux。哔哩哔哩微博哔哩哔哩

软件对老卡的解锁有多猛?小红书上一条独立的双V100实测(《两张二手老卡,跑平4090》)给了量化答案:刚跑起来时,长上下文只有36字/秒,第一个字要等七分半;重写attention内核之后,单卡涨到56;再插上第二张卡,到101.9——双卡是单卡的1.8倍。还有一条《V100二手卡,有人喊4500》的笔记把时间线拉得更长:专攻老架构的开源分支,今年3月23日跑通122B模型,8月31日把27B量化峰值推到280 token/秒,10月4日双卡版本峰值236。硬件没变,能跑的东西变了。小红书小红书

两张二手V100「追平5090」,数字是真的,价格已经不是了:32G单卡被喊到4000元、服务器内存翻4倍——捡九年前的卡之前,先弄清172 tok/s在什么条件下成立

一句话:2026年本地大模型的游戏规则,正在从"比算力"变成"比显存容量"。这是老卡翻身的全部合法性——数据中心退役卡恰好最多的是什么?大显存,而且曾经很便宜。有拆机V100 32G的玩家说得直接:16G只能算入门玩具,32G才算真正起点。注意"曾经"两个字。小红书

172 tok/s有几成水:把口径摊开对

作者自己在视频简介和评论区披露了多套数字,替他整理在一起:

口径

数字

说明

峰值

190.3 tok/s

标题里那个

中位

172 tok/s

同配置6轮取中位

日常体感

78-93 tok/s

知识问答、开思考模式

长上下文

1K时106.0 → 256K时87.4 tok/s

顶格只掉18%,比预期好

首字延迟

256K上下文TTFT 148.6秒

prefill按1756 tok/s全量吃一遍

单卡V100

33.5 tok/s

社区同款基线;官方参考值38-51

三个要点:

第一,"追平5090"有一长串前缀。双卡、176B MoE、IQ3_S量化、Strata引擎、社区Volta专用内核(要手动开STRATA_EXPERIMENTAL_SM60=1这类实验开关),再加锁频1380MHz、关ECC、layer-split 24对半分层等一堆参数,缺一个数字都会大变。单卡V100只有33.5 tok/s,不到峰值的五分之一。别把"双卡满调优+MoE专家全驻留"的成绩,误当成"V100"这个型号的成绩。评论区有位玩家贴的自测口径(200K上下文,测试条件未说明,仅作旁证):4090D 24G生成约90 tok/s、V100单卡32G约60、MI50单卡32G只有37——比V100更便宜的MI50,是用速度换的钱。哔哩哔哩

第二,真正的瓶颈不是吐字,是首字。256K上下文TTFT要等148.6秒。长文档、长合同场景,每轮对话开头干等两分半,这个体验折扣比tok/s大得多。作者自己在评论区也承认,真正该担心的不是decode,是首字延迟。哔哩哔哩

第三,口径有打架的地方。视频简介写MTP投机解码接受率98.6%,作者在评论区回复长上下文质疑时又说接受率恒定83%。两个数差了十几个点,没有解释哪个是什么口径。不影响大局,但拿这条视频当采购依据的人,应该知道它的粗糙度。另外要说明:UP主标注了配音和演示动画由AI辅助生成、实测数据来自本机日志,还主动写"评论区欢迎对线,我贴原始数据"——口径自觉比多数带货视频强,但31个粉丝、单机实测、暂无第三方复现,它现在是一份值得关注的个体样本,不是一份采购报告。哔哩哔哩

前面提到的那条小红书双V100实测,恰好能做交叉验证,而且把"口径"两个字演得更透:256K上下文代码生成,双V100跑到94.7字/秒,对手魔改4090 48G是80.9,上下文越长老卡优势越大;质量也没掉——300道题双V100答对237,4090答对236,只差一道。但首字等待完全反过来:同样256K,4090等210秒,双V100要等393秒,慢1.85倍,作者的原话是这一步卡在算力,软件补不了。堆卡堆得回吞吐,堆不回预填充——两份独立实测在这一点上口径一致。小红书

两张二手V100「追平5090」,数字是真的,价格已经不是了:32G单卡被喊到4000元、服务器内存翻4倍——捡九年前的卡之前,先弄清172 tok/s在什么条件下成立

还有个天花板要知道:评论区提到Strata目前最高只支持IQ3_S。这套双卡64G显存里,模型专家层IQ3约占52GB刚好放下,想上IQ4(约67GB)就得加第三张卡,溢出到内存速度立刻掉下来。显存封顶,模型质量也跟着封顶——买卡前想清楚IQ3够不够用。哔哩哔哩

价格先跑了:捡垃圾的窗口正在关闭

这是当下最值得写的部分,因为它正在实时发生。

为什么涨?《V100二手卡,有人喊4500》那条笔记给的判断比行情更有意思:V100涨价的原因跟别的卡不一样——不是硬件变了,是软件变了。上一节那条开源分支的跑分曲线,就是它的涨价曲线。但同一位作者顺手泼了盆冷水:280的峰值是跑分口径,后来实测的人在评论区交了底——写代码平均190,短上下文140,180K长上下文100,换一套不做张量并行的跑法,直接掉到30左右,同一张卡能差出近8倍。“跑分值不等于你手上的日常值”,这句话建议在付款前读三遍。小红书

两张二手V100「追平5090」,数字是真的,价格已经不是了:32G单卡被喊到4000元、服务器内存翻4倍——捡九年前的卡之前,先弄清172 tok/s在什么条件下成立

涨价的节奏,放在一条时间线上看更刺激:两个月前,二手V100 32G还是千百来块;10月5日有人在小红书发帖"大概3000一张",当天评论区就冒出两个新价——3800、4500;10月10日B站那条视频还在按"双卡六千出头"报账,当天评论区32G单卡已喊到4000元。往上游追,涨的不止它:笔记作者提到8月中华强北显卡全面封仓、普涨三到四成,DDR4内存套条跟涨,二手3090已经破万。MI50 32G"本来最有性价比的,结果涨价了";配套的DDR4主板在涨,服务器内存按那位UP主亲历是4倍。小红书哔哩哔哩

照4000元一张重新估:卡8000,加上同样在涨的X99双路主板、64G DDR4内存、大功率电源和服务器卡散热改造,整机奔着万元去了。差价从7倍缩到3-4倍——还便宜,但"魔幻性价比"没了,剩下的每一分便宜,都要用SM70社区内核、IQ3_S量化上限、148.6秒首字和功耗去换(一位4卡V100用户在评论区形容:“待机功耗惊人(load模型后)”)。哔哩哔哩

这不是V100一家在涨,是大盘在挤压。把微博上这几个月的信号排一排:三大存储厂把七成以上产能给了AI服务器,消费级内存被严重挤压,DDR5部分规格比一年前贵近5倍,“短期内看不到头,新晶圆厂从建到投产至少两三年”。7月底华强北出现"显卡一天大涨1000元"的报道,5月就有#英伟达显卡涨价300%#的热议。8月初科创板日报报道,连租赁商都开始拆售显卡和内存。还有行业观察帖直说,算力现在很短缺,老早的V100和A100都在用。微博微博微博

传导链条清清楚楚:新卡新内存太贵 → 需求外溢到二手大显存老卡 → 老卡跟着涨。6.5万播放那条视频的UP主有句话点破了上一轮:要不然也不会有这么多48G的4090出现!魔改48G 4090就是被这套逻辑先炒起来的,现在轮到V100和MI50。哔哩哔哩

省钱的另一头也在变。UP主"老T拆AI"前天算过三本账:二手3090按8033元、3年折旧,每月约223元,而Claude Pro订阅每月约135元;要跟按量API打平,对标DeepSeek最便宜档,每月得生成近6000万输出token。云端还在打价格战:有对比表显示Haiku 5.5输入每百万token十美分、DeepSeek 4.1 Flash高峰三十美分闲时半价、GLM 5.3 Flash十五美分。那条V100视频的评论区里,云租商已经闻着味进场了:4090按小时租一块多,用完就释放。哔哩哔哩哔哩哔哩哔哩哔哩

所以"六千块追平5090"这个故事,两头都在失效:硬件端入场费在涨,收益端云租和API价格在被摁着打。捡垃圾依然有价值,但价值回归到了"要算账"三个字。

这条路线到底适合谁

适合的三类人:

  • 跑百亿级以上MoE模型的:专家层IQ3约52GB,双V100的64G刚好全驻留,这仍是市面上最便宜的"64G显存"方案。你要跑的就是这类模型,且接受IQ3量化质量,这条路为你而修。

  • 有并发批处理需求的:作者的说法是显存够时开8并发效率最高,单路速度降下来,但总token数直接翻4倍。小工作室做批量摘要、打标、离线任务,按万元整机摊三年,比按小时租卡便宜得多。哔哩哔哩

  • 折腾党:置顶评论有完整参数清单(layer-split 24、mtp-hnorm stream、spec-min-p 0.80、kv k8v4等)和避坑提示——别开mtp-q4/coupled-draft、记得清僵尸进程否则速度暴跌。文档完整度在小UP主里算罕见的。

不适合的三类人:

  • 跑27B/32B稠密模型的:V100的大显存优势用不上,纯属花钱买罪受。看"老显卡实验室"的2080Ti系列更实在:两张2080Ti上NVLink桥,带宽16→25.78GB/s,decode从39提到53 tok/s,上下文从64K开到128K;单卡22G路线只有GGUF活得最好。稠密中小模型,2080Ti/3090方案均衡得多。哔哩哔哩

  • 长文档首字敏感的:148.6秒TTFT摆在那,重度读论文、审合同的人,要么等Maya那类分层预填方案成熟,要么直接租新卡。

  • 想开箱即用的:官方引擎对SM70的支持在退化,社区分支要自己编译自己维护,这个门槛真实存在,而且社区分支断更的风险没人担保。

“折腾"两个字具体多重?两条一线记录供参考。有人去年底3600元装完整台双V100主机,gpu-burn烤机两小时57°C,fp16训练"比租的4090快一点”,但坑单一串:主板BIOS必须打开Above 4G decoding否则点不亮、显卡负载波动时啸叫、忘买亮机卡白等好几天、机箱孔位对不上。另一位第一次上V100的更惨:这卡占3.5个PCIe槽位,第二张卡插不进去,只能用延长线外挂在机箱外,盖子翘着用了一个月。这些才是"拆机卡真香"背后的日常。小红书小红书

两张二手V100「追平5090」,数字是真的,价格已经不是了:32G单卡被喊到4000元、服务器内存翻4倍——捡九年前的卡之前,先弄清172 tok/s在什么条件下成立

最后给两个观察信号,比"买不买"更值得盯:一是V100/MI50的报价走势——32G如果普遍站稳4000元,这波捡垃圾行情基本可以宣告结束,别追高接盘;二是Strata官方何时收编Volta内核——官方支持SM70,老卡还有一波价值重估;一直靠社区实验分支,风险就一直在。那位UP主说下期用同样路子调GLM 5.3,值得标记追更,看第三方能不能复现172。哔哩哔哩

一句话总结:这条视频真正证明的不是"二手卡便宜",而是"显存是本地AI的新硬通货"。而在硬通货一天一个价的市场里,最贵的从来不是卡,是在高点进场。

内容由AI生成

精选参考来源

1. 实测:两张二手V100跑出190 tok/s,同场景追平四万多的RTX 5090|176B大模型本地部署全记录

2. 无恰饭!纯好奇测试:本地ai怎么玩会更好?

3. 丐版本地大模型推理服务器搭建指南 两张老掉牙的 V100,加上一颗折腾的心,能不能扛住刚发布的 Qwen3.8-27B 和其他本地大模型?本期视频带你沉浸式体验丐版 GPU 服务器搭建的酸爽过程! AI硬件 小A聊AI的微博视频

4. OpenAI 把智能 UI 推给所有用户,回答能直接长出交互界面;两张老 V100 跑起全模大模型;谷歌 7.4 亿参数向量模型手机也能跑

5. 两张二手老卡,跑平 4090

6. V100 二手卡,有人喊 4500

7. 果然32G显存,才是跑本地AI的起点

8. 2080Ti跑27B三个月实测(下):双卡显存账本+去审查模型+选型口诀 | 老显卡实验室

9. 3600元双卡v100主机DIY

10. 第一次组V100就被上了一课|显卡太大只

11. 内存涨价,导致的手机涨价、电脑涨价、显卡涨价!去年12+256GB相比涨了三倍多,第一次超过处理器成为手机里最贵的元器件。DDR5更夸张,有些规格比一年前贵了将近5倍。全球三大存储厂商把七成以上的产能全给了AI服务器,消费级内存被严重挤压。而且短期内看不到头。新晶圆厂从建到投产至少两三年,三大厂商2027年产能已经全部售罄,高盛说这是过去15年最严重的供应短缺。今年Q4大概率是价格最高点,2028年才可能真正缓解。能省就省吧,旧手机换块电池再战两年。

12. 【#显卡一天大涨1000元##电脑装机大涨价#】暑期是大学新生装机、学生群体换电脑的传统旺季,但今年暑期却成了不少学生和玩家眼中的“最贵装机季”。随着AI算力的火爆,全球存储芯片市场正经历严重的供给短缺。在深圳华强北,价格传导效应已清晰可见。华强北多家商户表示,受英伟达对全球授权显卡生产商发出新一轮涨价通知的影响,目前各大显卡品牌的工厂都已经全面执行封仓政策,暂时停止对外批量出货,全流通环节的现货供给快速收紧。记者走访华强北多家装机商户了解到,由于新货出不来,存量库存成为“稀缺资源”,渠道商普遍惜售,推动现有库存价格走高。有商户介绍:“采购商通知之后,这两天涨价幅度在30%左右。RTX 5070(显卡)去年零售价格在4500到5000元,目前价格是6000到6500元,RTX 5080平均价格去年是8000元,现在零售价接近12000元。基本就是一天一个价,一天平均涨幅500到1000元。”央视财经记者统计发现,华强北主流型号的存储产品和显卡价格持续攀升,其中:1TB固态硬盘去年9月410元,现在950元,涨幅132%;16G DDR5内存去年9月450元,现在1850元,涨幅311%;32G DDR5内存去年9月900元,现在3800元,涨幅322%;显卡方面,RTX 5060从7月22日的2300元涨至3000元左右,涨幅约30%;RTX 5080从7月22日的8000元涨至12000元左右,涨幅约50%。央视财经的微博视频

13. 算力现在很短缺,老早的V100和A100都在用。在某个时间点以后,算力就会大幅过剩,因为优化很厉害图为大模型榜单,artificial intelligence的分数。这是说Meta的Muse爬上来了。就很多家都能搞挺高分的,谷歌的Gemini被嘲笑了,还没发力。这榜单还有个特性,省钱的、速度很快的模型多了。这是中国开源大模型带来的风气,说明了优化的潜力很大。就和以前AlphaGo下围棋一样,开始要一个房间的服务器支持,几千块TPU,阵仗很大。后来优化到一块强卡就能跑,轻松指导世界冠军涨棋。下围棋的算力过剩了,需求没那么多。大家还是喜欢和人下棋,看人下的棋。原始的大模型本质就是一个极为低效的计算过程。现在美国头部模型追求高性能,优化就没怎么搞,是极为浪费的,矩阵计算绝大多数都可以狠狠优化。现在业界潮流逐渐转向优化提升性价比了。现在是还没到时候,就说算力极度紧缺。阿里说,2020年以前买的V100和A100都在狠命用。芯片在生产,理论上没有上限,要多少有多少。美国实际不缺芯片,缺电力和数据中心。中国AI芯片也在放量,规划非常宏大,一个月几十万片,一年上千万个AI芯片只是时间问题。以前互联网也是缺带宽,不停加光纤,还优化传输算法,最后就够了。算力也是一样,很缺到过剩,就是一个必然的技术过程。人就这么多,几十亿人。很多人对AI没什么兴趣,看见AI内容就反感。要么就是浅层使用,当大号搜索引擎用。跑Agent没完没了的,搞规模很大的coding的,没有很多人。一般人就是编点小程序,需要的token不多。这么算下来,对token的需求有个上限。等大模型生产token的能力超过需求,不会停,还会继续优化提升token生产力,过剩就来了。很牛逼的智能,以白菜价价格提供。这是竞争的必然结果。

14. 为了Token自由买显卡?我算了三本账:订阅、API、本地跑模型,哪个更划算

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章