一周三个端侧大模型连发:2B都能跑Agent了,那台"AI专用电脑"先别急着买

源自209位全网作者

04:30

如果你这周刷到过"面壁开源MiniCPM5-2B",大概率也顺手刷到了华为端侧MoE和讯飞星火X2.5。单独看每一条都是行业新闻,排在一起看才有意思:2026年9月的第一个星期,国产端侧模型像约好了一样连发三款,而手机和开发板的端侧算力,恰好在这前后追上了。

对一个早就想"让AI别老等云端"的人来说,这一周真正该想清楚的问题不是"又发了什么模型",而是:端侧AI的门槛已经降到你的旧设备里了,那台传闻中的"AI专用电脑",你还需要吗?

一周三连发,加上两周前的芯片,这是条完整的供应链

先快速排一下时间线,每条都给你留了可核对的数字:

  • 9月1日,讯飞子公司词元星火正式开源星火X2.5-4B和星火X2.5-1.7B两款端侧通用大模型,官方口径称这是端侧模型中首个原生支持最长100万Token上下文的产品。知乎

  • 9月7日,华为官宣行业首个端侧MoE(小尺寸3B模型+按请求激活部分参数的20B稀疏模型),主打离线场景:没网的飞机上,一句话整理相册。知乎

  • 9月8日,面壁智能OpenBMB(清华团队)开源MiniCPM5-2B:官方称其34项基准平均分53.9,超过参与对比的全部更大规模模型,ArtificialAnalysis智能指数以23分居4B以下开源模型第一。哔哩哔哩这次开源把权重、训练数据、数据治理方案和强化学习框架一起放了出来。知乎

一周三个端侧大模型连发:2B都能跑Agent了,那台

硬件侧其实早铺垫了两周:8月24日小米发布玄戒O100,官方称其为首颗专为端侧大模型而生的高带宽AI加速芯片——6nm晶圆级垂直堆叠封装,1.22TB/s带宽达到传统旗舰手机的16倍,端侧推理速度最高330TPS。微博搭载Xiaomi MiMo端侧模型的O100原型机,实测推理速度可达每秒295 Tokens。微博9月7日麒麟9050 Pro发布、由Mate XT 2三折叠首发,发布会上余承东罕见地用了20分钟单独讲这颗芯片。小红书

模型、芯片、整机一周内对上了榫眼。这就是"端侧AI"今天值得你停下来的理由——不是某一款产品,而是一整条链在同一周里表态。

一周三个端侧大模型连发:2B都能跑Agent了,那台

抢购潮的另一面:厂商说"小时代",先别替厂商兴奋

另一边,“为AI单独买台电脑"确实是今年真实存在的消费现象:今年1月下旬,一个叫Clawdbot、后来被叫作"龙虾"的Agent走红,直接引发了一轮Mac mini抢购——人们开始为一个随时能干活的AI,单独准备一台电脑。36氪苹果顺势把新款Mac mini的卖点从办公创作改成"全天候运行智能体”,Mac Studio继续向本地跑大模型的人卖大内存;小米则展示了三颗玄戒芯片装进一个铝合金方盒、配80GB统一内存的AICube原型;英伟达去年10月起交付128GB统一内存的DGX Spark,联想、华硕、惠普、戴尔围着GB10出一圈整机;新款M6 Mac mini 6999元起、内存最高32GB,8月27日预售的Mac Studio最高给到512GB统一内存、带宽提到1.2TB/s。

一周三个端侧大模型连发:2B都能跑Agent了,那台

听起来像大时代开幕。但36氪自己给这段行情起的名字是"小时代"——而知乎上另一篇被转发的判断更直接:到2027年,端侧AI才可能迎来一个真正的商业化窗口。知乎端侧部署圈子里流传的说法更扎心:端侧AI Infra落后云端3年,云端是batch>1单模型服务,端侧是batch=1多模型切换,工程栈整个是反的。知乎8月那台被201条评论吵翻的零刻SEi13迷你主机评测,UP主自己的结论就是"把它叫AIPC是容易有误解的"。哔哩哔哩

热闹是真热闹,两种声音都值得听。而把两边的账拆开算,就能看出一个容易被忽略的事实——

反直觉的核心:先把门槛打下来的不是硬件,是模型

大家默认端侧AI卡在手机装不下、内存不够、算力不够。但这一波开源模型真正改变的,是"能干活的最小算力单位":

  • MiniCPM5-2B只有2B参数、标准LlamaForCausalLM架构、131072上下文,却支持工具调用、深度搜索、代码生成,初步实现了端侧通用Agent雏形。知乎B站已有开发者实测,这张RTX 3080就能跑、训练栈全开源。哔哩哔哩

  • 星火X2.5-4B把100万Token上下文端侧化,意味着"整本书/整个项目代码库在本地问"第一次有了端侧解法。

  • 你手里的旧设备比想象中能打:不少Mate 80 Pro Max用户已经在设置里挖出了8.27GB的系统本地多模态模型,还在帖子里互相比"你的机型模型多大"。小红书一张6TOPS NPU的RK3576开发板(几百块)被实测端侧部署千问3.5,同时支持对话和图片识别。哔哩哔哩1.3B的MiniCPM-V 4.6在6GB内存的手机上就能做本地视频和图像理解;北大9月5日开源的端侧MoE自推测解码方案,在Jetson Orin上把推理最高加速5.3倍。知乎

一周三个端侧大模型连发:2B都能跑Agent了,那台

Elo 831距离人类基线1000还差169分——2B模型干不了云端旗舰的活,这是事实。知乎但"离人类还远"和"离可用很近"同时成立:把相册分类、离线问答、盯文件的轻量Agent这类任务从云端撤回本地,质量账本在这一周正式翻篇。买不买新设备的答案,恰恰藏在这个错位里。

三种人三本账:什么时候真该掏钱

轻度用户:一分不用花。 如果你的需求是断网整理照片、离线问点东西、修个图打个字,手机系统已经内置了答案——华为小艺的设置里在鸿蒙7更新后出现了"本地大模型"选项,全靠用户自己挖掘。小红书vivo X500系列也把5000多种场景识别标签放进了端侧运行。微博这类需求买任何新设备都是浪费。

折腾党:先白嫖,再花钱。 想跑端侧Agent、私域知识库、RAG的,先用手里的旧电脑、那张吃灰的3080或者几百块的开发板,拉MiniCPM5-2B或星火X2.5-4B试一遍。但这条路上有个比硬件更值钱的注意事项:端侧Agent的安全模型和云端完全不同——用云端是把数据交出去,在本地放一个能读写你文件的Agent,是把系统权限交出去。DeepSeek开源的Agent框架上线一天star破七万,十一天被挖出五个漏洞,含一个CVSS 9.8的极危远程执行。哔哩哔哩先配好沙箱和独立账号,再谈全天候智能体。

主力生产力:该买,但先等三个节点。 27B以上模型当主力、或者真要7×24跑Agent,内存墙绕不过去——按4比特量化粗算,70B模型仅权重就约需35GB,内存决定装多大、带宽决定跑多快(DGX Spark的273GB/s和Mac Studio的1.2TB/s就是两档体验)。36氪这个预算我建议看到9月下旬再动手:小米18 Fold本月首发玄戒O3、9月22日新款Mac Studio发售、Mate XT 2的麒麟9050 Pro首批用户反馈落地——三家的端侧软硬件捆绑方案都在同一个月见分晓,现在下单等于抢在比价之前。

一周三个端侧大模型连发:2B都能跑Agent了,那台

小时代的正确姿势

"小时代"不是唱衰,是定价:模型已经免费开源,设备还在挤牙膏,生态还在补课。这个窗口期里最划算的投资不是电脑,是让你现有的设备先跑起来——门槛每降一次,新硬件的溢价就少一分。值得持续盯的信号也很具体:MiniCPM5之后4B以下模型的Agent能力更新、20B稀疏端侧模型的软件栈成熟度、以及下一个"为AI配电脑"的需求到底能不能被一台旧笔记本接住。

如果这三件事有一件成了,你那台没买的专用电脑,就又省下来了。

内容由AI生成

精选参考来源

1. 端侧AI“小时代”

2. 国产2B端侧模型重磅发布,数据都开源了!

3. 面壁智能开源MiniCPM5-2B端侧模型,性能领先,其技术亮点与对端侧AI发展有何意义?

4. 面壁智能开源MiniCPM5-2B端侧模型(回答)

5. MiniCPM5-2B模型介绍

6. AI工业速递09-08晚间版:Kimi设计变压器、MiniCPM5开源、Adam参数化CAD、WeatherNext3

7. 国产端侧模型捅破天花板,科大讯飞这次玩大了

8. 华为推出首个端侧MoE,支持离线语音整理相册,这预示着手机AI怎样的发展方向?

9. 玄戒O100,小米首颗专为端侧大模型而生的高带宽AI加速芯片

10. 小米玄戒芯片技术沟通会发布两款原型机(玄戒O100原型机、小米AI Cube原型机)

11. 9月7日发布会正式官宣——麒麟9050 Pro,由Mate XT 2三折叠首发

12. 2027,可能是端侧AI真正兴起的一年

13. 端侧AI Infra落后云端3年:Orin上缺的不是编译器,是一个batch=1的多modelset的vLLM

14. 零刻SEi13AI测评,24G独立内存的NPU,值得吗?

15. 手机升级鸿蒙7后,支持查看本地大模型了

16. RK3576开发板端侧部署千问3.5模型

17. 北大开源端侧MoE自推测解码方案,推理加速5.3倍,技术有何突破?

18. 华子太低调了,藏着本地多模态大模型不说

19. vivo X500系列AI摄影助手端侧场景识别

20. DeepSeekHarness开源11天爆5个漏洞:AI读网页电脑被控

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章