最近想给本地大模型扩显存的兄弟,大概率刷到过那条视频。B站UP主司波图9月24日发了期《听劝买了两张2080Ti 22G!双卡+NVLink跑AI》,斥资5000多拿下两张七彩虹2080Ti 22G魔改版,外加近400块的NVLink桥,两天6.6万播放、3900多赞。 评论区画风已经变成:“大波波视频一出,这卡2500涨到3000了”。哔哩哔哩
为什么这个时间点值得聊聊这事:9月装机市场全线涨价,内存、主板、固态都在涨,装机博主的原话是"能等等就等等"。 新卡贵,二手3090也跟着水涨船高,于是"2018年的老核心+魔改22G显存"成了预算党手里最粗的显存杠杆。但跟风之前,这笔账得先算明白。小红书

一、这卡现在到底能干啥:把全网实测扒了一遍
先说结论:22G显存+图灵架构,正好踩在当前本地AI的两个甜点上——27B级大模型和ComfyUI视频生成。
跑大模型的实测数据,来自多个独立玩家的部署记录:双卡组成44G显存池,NVLink互联,Ubuntu上用vLLM跑Qwen3.8-27B的FP8量化,开MTP3,上下文拉到128K,输出速度约80 token/s。 UP主评论区里的深度玩家(x99平台+双卡+NVLink)反馈:接入生产项目后实战50-70t/s,纯填充prefill稳定在1100-1400,256K上下文单流满上下文掉速不严重。小红书
预算只够单卡的话:Qwen3.8-27B的q4_k_xl量化权重17.9GB,22G显存能开150K上下文,速度45t/s。 9月21日刚开源的社区方案(github上搜qwen3.8-2080ti-256k)做到q4km级别质量+256K上下文,简单任务峰值接近67 tokens,日常任务大约50 tokens。小红书小红书

80t/s什么概念?比很多人云端API的流式输出还快。写长文、挂本地agent、跑知识库问答,这个速度日常完全够用。
视频生成这边更夸张:图灵架构原生支持CK Attention,ComfyUI跑MiniMax H3,UP主实测单卡能正面硬刚他上期评测的B65,还把16G的4060Ti按在地上摩擦。 小红书玩家8月底的加速方案,让一张2080Ti 22G本地生成15秒原生音画视频,之前要2小时46分,玩家自述加速4倍。哔哩哔哩小红书
二、价格账:这30天它是怎么涨上来的
这卡的价格轨迹本身就是个故事。8月上旬的装机帖里,两张2080Ti 22G加一块NVLink的价钱是1840元+2250元+245元。 到8月中,涨到2500元;9月24日视频发出后,评论区确认"现在单卡2500左右",且有玩家表示已经看到涨到3000的。小红书哔哩哔哩

整机路线参考:有玩家用E5-2696v4(304元)+双2080Ti 22G+NVLink+1300W白金电源,加水冷改装和一堆配件,全套8298元——等于8000块抱回家一台80t/s的27B推理机。小红书
对照组:有玩家的原话是"2500元就能1万元rtx3090 24GB接近效果"。 知乎玩家用双3090跑Qwen3.8-27B,上下文实测能拉到524K。 这是双卡2080Ti方案给不了的上限,44G显存池和带宽都差着一截。小红书知乎
还有隐性成本:双卡满载400W+,原装涡轮散热"起飞"的噪音,以及电费。好在评论区有玩家给出解法:用LACT把功耗限到180W、核心+150MHz,LLM场景大概保留九成性能。哔哩哔哩
三、坑:翻车实录不是个例
魔改卡的另一面,才是劝退多数人的部分。
第一,矿卡基因。2018年的核心,评论区共识是"百分百矿"。没有官方保修,全靠店保赌运气。
第二,翻车实录真不少。有玩家2025年7月发帖记录:Ubuntu下跑DeepSeek 32B,前一分钟输出飞快,然后风扇直升机起飞、屏幕一黑;换Win11继续刚,FurMark烤机不到1分钟直接黑屏断电,Stable Diffusion出图出到一半驱动崩溃。他的结论是"这种显卡不能去海鲜市场,pdd或者tb这种起码有店保,出问题还可以搞"。 还有玩家购卡经历更惨:烤机热点温度直接破百,店家换一张,还是翻车。小红书
第三,你买到的可能是翻新核心。有玩家自我安慰得很明白:“卡是新的,估计是旧核心翻新卡吧,毕竟2018年的产物!没事,能用就行”。小红书

第四,散热和风道要自己动手。上面那位8298元整机的玩家,为了压温度给一张卡改了水冷,另一张拆导流罩、3D打印外置导流罩和支架,才把满载温度压到54度以下。小红书
四、更便宜的路线:洋垃圾计算卡,省钱但费命
评论区高赞给出了另一条路:“如果预算有限,两张t10或者v100比他还便宜,显存还更大”,还有人建议趁着T10还在千元内直接收四张。哔哩哔哩
但这条路折腾程度完全不同档。知乎9月23日有篇V100装机实录:15代酷睿+特斯拉V100,从官网把驱动逐个往下试,从最新cuda13一直到cuda11,尝试十个驱动都有了,最后才在CUDA11.4上稳定点亮。 期间必须换Win10、关闭Resizable BAR、全程离线装系统防驱动被更新顶掉,编译llama.cpp还得用VS2019——用最新的反而不行。知乎
折腾完的回报是:9B模型从CPU推理的每秒10 token,干到90+。 计算卡的门槛从来不在钱,在驱动和心态。知乎
五、什么人该上车,什么人收手
适合上车的:手里是8-16G卡、明确要跑27B级模型/长上下文/ComfyUI视频生成、预算2500-8000、会折腾Linux和vLLM、对噪音电费不敏感的玩家。社区对价格的共识很直白:2000出头的价位有性价比,2500往上就得自己掂量。
建议绕行的:纯小白和要保修安稳的,买全新卡或者直接用API——本地部署从来不是"部署完就免费";只是偶尔问两句的,云端更省事;要塞整个代码库写代码的,先看上下文需求,双卡256K够大部分场景,追求上限还是3090方案更稳。
最后给几个观察信号:这波涨价是被视频短期带起来的,热潮过去闲鱼价可能回落,不急可以蹲;T10、V100这些计算卡一旦被带涨,千元内的窗口也在收窄;而内存主板固态的涨价潮短期看不到头,整体"等降价"的空间正在变差。
一句话总结:2000捡漏是垃圾佬的浪漫,3000跟风就是给矿卡接盘。你手上现在是什么卡,在跑什么模型?评论区聊聊。