跑本地大模型最便宜的门票,正在从显卡变成一块"拆车件"。
8月2日,B站"老张是大佬"把一块新能源车视觉计算主机搬上桌跑了 Qwen3.6-35B,视频播了7.5万。 随后小红书"iSenlink清风小筑"把行情摆了出来:配 Nvidia Orin-X(TA990SA)、32G统一内存+128G UFS 的智己拆车车机,裸件大约800元——同档显卡动辄3000元,这看起来是给AI玩家量身定做的捡漏神器。哔哩哔哩小红书
然后价格就开始离谱。在"笨木匠"的智己车机改装机视频下,热评第一写着"1000多的玩意被玩到三四千"。 它下面点赞最高的一条回复只有一句:“1000多就挺好玩的,超过2000就没价值”(33赞)。 9月8日,老张回头发了个《警告:不要玩》,1547赞、176条评论。 9月27日,VoidTech 又把一块 Thor-U 拆机板搬上桌实测,实际购入价1800元,不含供电散热。小红书哔哩哔哩哔哩哔哩
一边是"33 tok/s 跑得飞起",一边是"警告别碰"。我把全网11组社区实测、三条价格线,和那176条评论里的坑,摆成了这一张表。
一、速度表:同一个Orin,有人40、有人9、有人12
以下全部是玩家自测数据,口径不完全一致,我只做归队,不替任何人背书:
主机 | 跑的模型 | 实测速度 | 来源 |
|---|---|---|---|
Orin-X 成品机 | qwen3-coder-30B-A3B-Q4 | 40+ tok/s | 闲鱼卖家(iSenlink问询) |
Orin-X 社区 | Qwen3-30B-A3B | 15–25 tok/s | iSenlink清风小筑 |
Orin-X | Qwen3.6-27B / 3.8-27B(稠密) | 约9 tok/s | iSenlink清风小筑 |
Orin-X | Qwen3.6-35B-A3B | 均值27 tok/s | sartiya(8月5日) |
Orin-X 智己改装机 | 35B-A3B @131K上下文 | 33 tok/s | 笨木匠 |
Orin-X 智己改装机 | 27B @131K上下文 | 12 tok/s | 笨木匠 |
Thor-U 64G | qwen3.8-27B | 31 tok/s | 社区记录(转引自iSenlink) |
Thor-U 64G | 27B生成(开MTP) | ≈DGX Spark的七成 | VoidTech实测 |
对照组:二手2080Ti 22G | 27B级 | 平均37 tok/s | 笨木匠评论区(6赞) |
对照组:V100 32G PCIe | — | 算力约Orin-X的3–4倍、即插即用 | iSenlink清风小筑 |
数字打架吗?表面打,拆开看全对得上:同一块板子,跑 MoE 时 15–40 tok/s,跑稠密 27B 就掉回 9–12。这不是玄学,是算术。卖家成品机上跑的 qwen3-30B-A3B-Q4,实测就是这样稳定在 40 往上,但也只到"聊天还可以,做事就不行了"的程度。小红书

二、决定吐字速度的,不是250TOPS,是那条带宽
拆车件帖子里最响的卖点永远是"250TOPS算力"“2048个CUDA核心”。 但本地党今年都该背下来的一条规律是:解码阶段每生成一个 token,都要把"被激活的权重"重新读一遍,速度上限约等于内存带宽除以激活权重大小。算力决定你算得多快,带宽决定你能不能"喂"进去。这块32G统一内存,实际可跑的也就30G出头,装完系统剩多少权重空间,tegrastats 不会骗人:小红书

Orin 这一代 LPDDR5 带宽约 205GB/s(官方规格)。稠密 27B 量化后约 15GB 权重,205÷15,理论上限 13 tok/s 出头——社区实测 9–12,基本已经顶着天花板跑,没有任何优化空间。而 MoE-A3B 每个 token 只激活 3B 参数、约1.5–2GB 权重,上限立刻翻一个数量级,实测 15–40 就全落在这个区间里。
所以 iSenlink 那句被转很多次的判断并不主观——“它恰好是唯一一种 Orin 的带宽喂得动的模型,同时也是能力上限最低的一类:日常聊天够用,复杂推理和正经写代码就吃力。” 聊天够用,写代码、干长活就露馅——sartiya 把 Orin 接上位机跑 agent 的原话是:“简单任务可以,过于复杂的任务就要处理很久了。”小红书小红书
带宽更高的 Thor-U(273GB/s,社区已有人拿 qwen3.8-27B 跑到 31 tok/s)才第一次让稠密模型在拆车件上"像样"。 但 VoidTech 的对照实测补了冷水:同样开 MTP,生成速度约 DGX Spark 的七成;一到长文本 prefill,差距明显。 捡漏捡的是解码带宽,干活卡的是读取带宽,这是两笔账。小红书哔哩哔哩
三、价格账:捡漏窗口只有一次,1000元前
把社区口径排成一条线:
800–1000元(裸拆车件):捡漏成立。你买到的是"低功耗 MoE 聊天后端",笨木匠实测运行功耗 26 瓦、GPU 全开 80 瓦,当一台永远在线的轻活机器确实便宜。小红书
2000–3000元(装好模型和小龙虾的成品):你付的不是算力钱,是折腾钱——“已经装好大模型和龙虾,价格大概在2000-3000元”。 而 MikkoCao 这种自己动手的,光配环境、编译 llama.cpp 就花了两周末才跑通。小红书哔哩哔哩
3000元以上(被玩家炒上去的价):社区共识已经替你算完——“超过2000就没价值”。同预算段,评论区的答案很直接:“rtx3060 12g 不到2000不是更好”;要显存,V100 32G PCIe 插上就认卡,算力3–4倍。
现在闲鱼上挂着的 Orin-X 开发板,成品和改装件混着标,1999 元这一档已经贴着"没价值"线了:

也就是说:这波"智己车机值不值"的争吵,答案取决于你出手的价格在窗口哪一侧,而这波拆车件"价格都涨了好几倍"。 涨破之前它是捡漏,涨破之后它是接盘。哔哩哔哩
四、176条评论摆出来的坑,比速度表更值钱
"警告:不要玩"那期视频的评论区,基本就是这份拆车件攻略的避坑清单:
变砖即报废:"凡是没有系统固件流出的设备都不建议玩。"bootloader 锁死、镜像载不上、rootfs 只读,还有熔断机制兜底——“系统挂了还没有恢复系统的办法,那不就是一次性的东西”。哔哩哔哩
CUDA 升不了:笨木匠帖下的实测回复——"不能,只支持老版本的cuda。"这意味着新引擎、新量化方案基本和你无关,你的模型生态停在旧版本。小红书
它可能还在"给车里报告":评论区有人点破——这台机器联网跑起来,会不会继续向吉利的服务器发送消息? 拆车件不带车,出厂后的数据通路只能自己断网处理。
改装红线:社区普遍划的线是"别碰在售车型",域控不是手机,魔改的边界和法律风险都没人替你兜着。
外围吃掉差价:供电、散热、装机——笨木匠改完散热嫌噪音大,再改一版加了温控和双电源。 VoidTech 的原话是"板子便宜,供电、散热和软件环境还得自己折腾——省下的钱,可能要拿周末来补"。小红书哔哩哔哩
五、谁值得玩、谁别碰、接下来盯什么
值得玩的:手上已有主力机器、就想补一台 26 瓦低功耗 MoE 聊天/简单 agent 后端,预算卡在 1000 元以内,且接受"变砖即扔"的人。这个价位、这个功耗,Orin-X 拆车件目前确实是独一份。
别碰的:想靠一块车机跑稠密 27B"正经干活"、想用最新推理引擎和量化格式、没周末可搭进去的人。9–12 tok/s 的稠密速度不是卖家坏、不是玩家菜,是 205GB/s 的物理天花板;这个预算老老实实走二手显卡路线更快回到正题。哔哩哔哩
盯三个信号再决定上车:Thor-U 的 DriveOS 7 固件和开发者资源有没有放出(决定它是玩具还是生产力);Orin-X 拆车价有没有从三四千回落回800–1000(决定捡漏窗口是否重新打开);社区里会不会出现不依赖成品卖家、自己装出 30 tok/s+ 的稠密模型记录(决定带宽账算到头了没有)。
说白了,这波捡漏的本质,是拿"智驾的富余算力"去填"本地大模型的入门焦虑"。价格没破千时,它是真便宜;价格破千后,那176条评论早就给出了下一句——便宜是捡来的,坑是自己的。