当前位置:
AIGC文章详情

14MB也叫大模型?Needle 2把4500万参数塞进十几块的ESP32,但它干的不是聊天

源自53位全网作者

08:38

最近三周,如果你关注硬件 DIY,大概率被这类标题反复刷过屏:「4500 万参数大模型跑在 ESP32 上」「14MB AI 模型在 10 美元芯片上运行」。说的其实是同一个东西:Cactus Compute 的开源工具调用模型 Needle 2,8 月中旬在 GitHub Trending 上迅速蹿升。它不是纯炒作:按公开文章的说法,8 月 13 日这天它在 GitHub Trending 上一天新增 346 星。知乎据搬运信息,相关话题在 Hacker News 上也拿到了 355 分热度。哔哩哔哩而大家真正想问的只有一件事:这么小的东西到底能干什么,我手里的板子能不能玩?

这篇文章把三件事说清楚:它是什么,它到底能干哪类活,以及你现在该不该上手。

Needle 2 是什么

参数只有 4500 万,打包后是一个 14MB 的二进制文件,推理时内存占用约 28MB。知乎它不是凭空冒出来的:早在今年 5 月,v1 版 Needle 就在圈子里出过名——26M 参数,从 Gemini 3.1 蒸馏而来,量化后只有 14MB,手机本地跑出 6000 tok/s。哔哩哔哩这次二代把参数做到 4500 万,体积仍是 14MB,目标很明确:资源受限的端侧设备。

它不干你以为的「大模型」干的事。它的全部设计目标只有一个:在资源受限的设备上,可靠地执行函数调用和结构化数据提取,不闲聊,也不写诗。知乎你给它一句话,它还你一个 JSON,告诉你该调哪个函数、参数填什么。

社区里传播最广的演示来自 BetterStack:把 Needle 2 装进 ESP32-S3 微控制器完全离线运行,自己搭推理引擎,用自然语言命令控制 LED、报告置信度,遇到工具范围外的问题直接拒绝。哔哩哔哩每次回答还附带一个把握分数,拿得准的自己办,拿不准的转给云端大模型。小红书

14MB也叫大模型?Needle 2把4500万参数塞进十几块的ESP32,但它干的不是聊天

4500 万参数,怎么塞进 14MB

这是最反直觉的部分。算一笔账:4500 万参数 × 每参数 2 bit ≈ 11.25MB,加上索引和开销,14MB 刚刚好。Needle 用自研的 CQ(Cactus Quants)方案,把权重直接烘焙进推理引擎,生成单个二进制文件,推理时零网络请求,权重就是引擎本身。知乎推理加速靠 n-gram 哈希查找和 Hadamard 变换,这也是它小体积还能保持高性能的技术原理。哔哩哔哩

14MB也叫大模型?Needle 2把4500万参数塞进十几块的ESP32,但它干的不是聊天

内存也算到了极限:256-token 滑动窗口,工具固定为 KV sink,对话再长内存也恒定在 28MB 上下;你可以挂 50 个工具的目录,但每轮只激活最相关的 5 个,未选中的工具直接不可达。知乎输出层还有一道锁:输出被语法约束框着走,返回的一定是标准格式数据,程序拿来就能用。小红书这解决的是小模型落地最大的痛点:你不用再写一堆容错代码去兜 JSON 解析失败。

所以最容易被误解的一点来了:Needle 2 不是聊天模型。社区里有人总结得精辟:llm(×)large language model,llm(✓)lite language model。哔哩哔哩演示里它能精准开 LED,你让它闲聊它直接拒答——这不是翻车,是设计目标。

社区在干什么:泼冷水的,和真上手的

这个方向不是 Needle 一家在唱。不久前有人把一个接近 15MB、约 2890 万参数的语言模型完整装进一块 ESP32-S3 开发板,模型真的运行在芯片上,能在小屏幕上续写简单的英文故事,实测速度接近每秒 9.88 个 token。小红书它背后的开源项目 esp32-ai 还在 Arduino 平台上把 TinyStory 和中文模型 MiniMindSmall 跑成了全离线。哔哩哔哩那条实测视频播放 1.7 万,收藏 793、评论 103,收藏比点赞还高——明显是存下来准备自己试的人。

但评论区比标题冷得多。最高赞评论说得直白:这种参数的 LM,最大价值就是给手机输入法当联想模型。哔哩哔哩也有人提醒「感觉幻觉很强」,说这种侧端小模型一般是用来辅助判断的,根本不是用来对话的。

也有真上手的人。一位 esp32 零基础的小红书用户,用 ESP32-S3 给锂电池保护板做了一个带 GPS 时速的数据监控,自谦手残焊得巨烂,「能跑就行」。小红书这类玩法的门槛其实就是一块板:有人在评论区问哪里卖 10 多块的 esp32s3,得到的回答是「之前淘宝用了消费卷,11.2 一个」。哔哩哔哩

14MB也叫大模型?Needle 2把4500万参数塞进十几块的ESP32,但它干的不是聊天

厂商也在往这个方向下注:乐鑫 8 月中旬推出 ESP-Claw,在设备侧塞进一个 Agent Runtime,支持 Event Router、Skill、Capability、Lua、记忆和硬件联动。哔哩哔哩思路还是那条:确定性流程交给规则,不确定的理解和编排交给 Agent。

谁现在可以上手,谁先观望

手里已经有 ESP32-S3 的你:直接上,成本为零。Needle 2 以 Python 包形式发布,核心依赖轻量,推理引擎会在首次使用时从 Hugging Face 缓存。知乎一个下午就能复现官方工具调用 demo;微控制器侧,也已经有在 ESP32-S3 上完全离线运行的实测可以参考。哔哩哔哩

想做实用工具的你:方向对,但还没到成品时刻。中文支持是第一道坎,有动手的人直说,纯量化路子没办法直接用,自己训的中文小模型「质量不够,只能演示」。哔哩哔哩置信度是第二道坎:本机实测里,输入 do not lock the door 仍返回锁门调用,confidence 只有 0.3257,正常锁门的 confidence 也只有 0.4888。小红书实测者的结论:置信度阈值能挡住一部分错误,但不能替代业务校验。

想让它跑「更大模型」或当聊天助手的你:直接放弃。评论区有人认真算过账:想跑 4B 模型,需要至少百片 esp32 并行,还要精细处理同步和 74 电路扩展 spi,速度只有 0.5t/s,结论是「还是不搞了…说树莓派 5B 更合适」。哔哩哔哩中文聊天也一样:本机实测 8 条中文指令只通过 1 条,作者自己也承认,中文不在当前宣称的开箱能力里。

一句话收尾:Needle 2 是很有潜力的本地动作候选器,但还不是可以放心直连设备的执行器。小红书接门锁、接家电之前,先搭一层模拟环境,把否定词、必填语义、单位、重复调用、高风险动作跑一遍,再谈真机。

三个值得持续关注的信号

  1. Cactus Compute 会不会放出开箱即用的 MCU 推理库——这决定 Needle 2 是停在「自建引擎跑 demo」,还是真正进硬件。

  2. 社区中文蒸馏小模型的质量——esp32-ai 的评论区已经有人在等一份中文训练方案。

  3. 乐鑫 ESP-Claw 的工具链进度——设备侧 Agent Runtime 会不会成为智能硬件原型的标配。

想上手的人,行动顺序很简单:先装 Python 包复现工具调用 demo,再接模拟层跑一遍测试用例,最后再决定要不要动烙铁。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章