先别急着换显卡:核显已经能跑 25t/s,浏览器里塞得下 1.5B,云端 3080 一小时一块多——这轮"免费本地推理"的五条路,先把你旧机器的上限试出来再谈掏钱

源自239位全网作者

21:51

这一个多星期,本地推理圈的火药味淡了,“白嫖味"浓了:B 站有人拿 20 年前的老笔记本跑本地大模型,知乎有人把 15 亿参数的模型塞进浏览器批量处理 Excel,同一周还有人写教程把吃灰的安卓手机变成一台 OpenAI 兼容的推理服务器,紧接着 10 月 2 日,连"一块多一小时"的云端部署教程都上新了。你会发现,这轮讨论的关键词已经不是"8G 显存能不能跑 27B”,而是:不动一分钱硬件,我手上这台旧机器,上限到底在哪?哔哩哔哩知乎知乎

先给结论:免费路已经摸到了"够用"的门槛,但每条路的天花板都钉死在两个数字上——内存/显存带宽,和电费。下面按"你手上是什么机器"来对号入座。

一、AMD 核显小主机/笔记本:这是免费路里唯一能"干活"的一档

如果你有一台 7840HS/7940HS 这类 780M 核显、32G 内存的机器(很多打游戏退役的迷你主机就是这个配置),B 站 UP 主 kingzeron 在 6 月初给出的方案到现在还是核显党的标杆:Linux 下把核显显存上限拉到 28G,跑 Qwen3.6-35B-A3B 的 Q4 量化,开 256K 上下文,实测输出 25 tokens/s——这个数字已经超过了大多数人的阅读速度。哔哩哔哩

评论区比视频更值钱,三个月下来把坑踩全了:

  • Windows 下最多只能分一半内存给显存,Linux 才能突破。有人 Win11 分 17G 共享显存跑 Q4,“开始有 20-25t,后面会降到 12t”,换 Q3 量化才稳住 18-22t,但上下文只能开到 68K。哔哩哔哩

  • 笔记本党(8845HS)反馈散热拖了后腿,全 GPU 加载"只能到 24 tokens/s 左右"。

  • 倒是 7840HS+96G 内存的老哥说,35B 拉满上下文跑长文本,速度不会明显掉。

天花板在哪?评论区吵得最凶的一条其实给出了答案:DDR5 内存带宽 100GB/s 上下,对比 RTX4060 的 288GB/s 就是先天残疾——所有"统一内存"路线,包括 128G 大内存的核显机和迷你 AI 工作站,速度都会封顶在几十 token 每秒。这不是软件能修的,是物理。哔哩哔哩

另一条账是电费。评论老哥给的口径:780M 小主机性能模式峰值 60W,常年开机一个月电费不到三十块;而另一边 E5+P100 的"垃圾佬神机"跑 20-30t/s 看着香,满载接近 500W,“月用电算 250 度,电费就要 150 元”,他的结论就四个字——性价比不高。哔哩哔哩哔哩哔哩文游党则给出了另一个生态位:通用模型文风"不是太油腻,就是太 coding",“本地化中小型模型,是可以拉去做微调对齐训练的”。加上"文件不能上云"的合规刚需,这三类需求,25t/s 都接得住。小红书

二、浏览器:0 安装、0 下载、数据全程不出电脑

知乎用户 Kainy 9 月 23 日的实践帖适合完全不想折腾命令行的人:MLC 团队的 WebLLM 让模型直接跑在浏览器里,靠的是 WebGPU——Chrome 113 之后的浏览器自带的能力,普通核显就行。默认跑 Qwen2.5 的 1.5B 版本,量化后权重约 1G,首次下载进缓存之后,“哪怕你拔了网线,它照样能干活”。他做的场景很具体:1000 行客户反馈的 Excel 情感标注,数据一个字都不用贴给公网 AI——对"公司三令五申不许把内部数据喂给在线大模型"的打工人,这个卖点比速度值钱。知乎

先别急着换显卡:核显已经能跑 25t/s,浏览器里塞得下 1.5B,云端 3080 一小时一块多——这轮

两个提醒:想上 8B 级(Llama-3-8B),作者自己标注了"需要高性能独立显卡,别为难你的核显"。浏览器后台会对标签页节流甚至直接查杀,长任务要靠静音音频保活、IndexedDB 断点续传这类工程手段压住——自己搭的话,光这些坑就要掉一把头发。知乎

先别急着换显卡:核显已经能跑 25t/s,浏览器里塞得下 1.5B,云端 3080 一小时一块多——这轮

三、吃灰安卓手机:现在只值"关注",不值"上手"

同一周还有个小火苗:OlliteRT 可以把安卓手机变成一台 OpenAI 兼容的本地推理服务器,完全本地、开源。不过 9 月 30 日的教程帖互动还很小(赞同 1、收藏 1),手机 SoC 的带宽和发热决定了它现阶段是"极客盆景"。可以装,别指望它干活。知乎

先别急着换显卡:核显已经能跑 25t/s,浏览器里塞得下 1.5B,云端 3080 一小时一块多——这轮

四、20 年前的老电脑:能跑,但请把它当温度计

B 站 10 月 1 日那条老神州笔记本视频播放只有 177,机主在评论区留下的反而是这轮最清醒的自我校准:“别用单一参数估需求,还是得实测说话”,那台 4G 内存的机器"实际体验下来能有 16t/s"。老机器党适合干的事和核显党一样:长文翻译、批量摘要这种"丢进去不用管"的活。哔哩哔哩

想拿它跑 Agent 多轮对话的,劝退——评论区另一条话说得准:“短时峰值好看,持续跑才知道热不热”。这两周"本地 AI 跑 40 轮就崩"的翻车帖,也不止一篇。哔哩哔哩

五、云端一块钱:最接近"免费",也最容易被忽略两个成本

10 月 2 日的 autodl 教程给了第五条路:不用买 GPU,“每小时只要一块多钱,就能轻松部署开源 AI”,租 RTX3080、一键拉取千问、SSH 端口映射接到本机,还能挂 Claude Code。零硬件投入拿到独显速度,看着完胜前面四条。哔哩哔哩

但评论区的反驳同样真实:一小时一块钱,这价格够在 OpenAI 和 Anthropic 两家大鱼大肉了。两个隐藏成本:第一,你的数据照样出门,“本地推理"最大的卖点在这条路上直接归零;第二,按时计费意味着只有"用的时候才便宜”,长任务、挂机任务的账单会教你做人。哔哩哔哩

把五条路摊在同一张桌上

路线

你需要的东西

实测档位(社区口径)

数据在哪

首次支出

最适合

核显小主机

780M/8845HS+32G 内存

35B-A3B Q4,18-25t/s,68K-256K 上下文

本机

0 元(已持有则)

长文翻译/挂机任务/文游微调

浏览器 WebGPU

Chrome 113+ 办公本

1.5B,核显可跑,断网可用

本机

0 元

敏感数据批处理(Excel/文档)

安卓手机

OlliteRT

极小模型,性能未验证

本机

0 元

观望/玩

20 年老电脑

4G 内存古董机

小模型 16t/s 峰值

本机

0 元

验证好奇心

云端 GPU

autodl 账号

3080 级独显速度

云端

1 元+/小时

偶尔需要独显速度、不碰敏感数据

顺带一提旧独显党:8G 显存的 30 系卡这两周也没闲着,FreeToken 把 MoE 的高频专家缓存进显存、低频的丢给内存就地算,“8G 显存就能跑 35B 大模型,还飙到 40TPS”,接口兼容 OpenAI/Anthropic;MeshLLM 则把家里多台旧电脑连成分布式算力池,放不下的超大模型按层拆分跑。你们不在"免费路"的弃子名单里。哔哩哔哩哔哩哔哩

什么时候该掏钱,什么时候再等等

看完五条路,掏钱的判断线其实清楚了:

现在就可以掏的:你已经在核显机上试过 256K 上下文,撞到了 prefill 的墙——本地长文档"读得慢"比"吐得慢"更早劝退人。评论区 4070TiS 用户的配置单是这条线的参照:Qwen3.8-27B、IQ3_S、KV Q8、48K 上下文,llama.cpp 报 prefill 1100t/s、decode 55-60t/s,他的原话是"本地干活(有固定工作流跑通的)和 workbuddy 一样快"。从"玩具"到"干活"的分界线就是 prefill,独显带宽买的正是这个。小红书

再等等的:①被"旧机器跑 744B"这类视频点燃、想加硬盘再战的——两个月前那轮"低门槛"消息的教训还在;②刚下单或正纠结大内存迷你主机的——极摩客 EVO-X2 这类锐龙 AI Max+395 新机 10 月 2 日刚出"跑 235B"的实机视频,首批价格还没稳住,别在发布会情绪里签合同。③新一轮模型和引擎正密集进场——Spark-X2.5-4B 用混合注意力和 KV 拆分把内存砍到九分之一、在 4B 模型上做到 1M token 上下文;Strata 这类专为新模型写的新引擎,上周刚让 3090 跑 Flash-Next 的短问答从 20t/s 干到 67t/s。引擎和模型的迭代速度现在比硬件降价快,旧机器先跑起来的人,永远比囤好机器等模型的人少亏一轮。哔哩哔哩哔哩哔哩微博

这轮"免费本地推理"最值得抄的作业其实就一句话:这个周末,用你已经拥有的机器把一篇长文翻译跑完整,再决定要不要为速度花钱。评论区那句反讽留着给冲动的人——“硬件比买来的时候涨了 20% 了,这么算还是省钱”。但那终究是理财,不是推理。小红书

内容由AI生成

精选参考来源

1. 20年前的老电脑部署本地大模型是什么效果呢?🤔

2. 我把15亿参数大模型塞进浏览器:WebGPU本地推理让Excel批量处理数据不出电脑,断网也能用

3. 吃灰的手机也可以部署大模型了

4. 780M核显修改显存跑大模型保姆教程

5. 本地部署大模型真没用但真好玩

6. 云端GPU部署开源大语言模型怎么玩?几乎零成本!

7. Freetoken!8G显存跑35B模型!你家里电脑就能玩!

8. 多台旧电脑拼成一张“超级显卡”!开源MeshLLM把Mac、显卡主机和迷你电脑连起来,跨设备运行超大模型

9. 锐龙AIMax+395顶配,拿下235B大模型极摩客EVO-X2迷你PC,锐龙AIMax+395平台主打本地部署LLM大模型,优势是在本地、不上云、不花钱、无限

10. 这个本地小模型竟有100万Token上下文,怎么做到的?

11. 本地跑大模型的同学,可以试一下新出的推理引擎Strata(github.com/Niko1221/Strata)。Strata是专为Qwen3.8-Flash-Next开发的,针对模型做了深度优化。微博群里的同学实际试了一下:用RTX3090跑Qwen3.8-Flash-NextIQ3_S,短问答输出速度能到67tok/s,而同样硬件下llama.cpp只有20tok

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章