小红书 dots 实验室把 dots3 系列的第一款模型开源了,而且一上来就是多模态。
上周五(8月14日),dots studio 正式开源 dots3-note Preview。名字听着冷门,履历却不简单:280B 总参数的 MoE 架构,运行时只激活 16B,512K 上下文,文本、图片、视频、音频都能理解。知乎更扎眼的是它同系列的内部版本,上个月刚在 IMO 国际数学奥林匹克上拿到官方认证的 42 分满分。知乎
但社区第一周的实测,评价却完全是另一副面孔:编程测试大面积翻车,评论区有人吐槽 API"超级无敌不稳定",还有人直接把它拉来和美团 Longcat 2.0 对比。哔哩哔哩光环和现实差这么多,这模型到底能不能用?我翻了官方技术博客、知乎和 ModelScope 的技术分析,又对了几个 B 站实测视频,结论先说:值得试,但大多数人打开方式都错了。

它赌的不是"看图问答",是"长程任务"
先对齐一下认知。dots3-note 的定位,跟我们平时讨论的多模态大模型不太一样。
多数多模态模型卷的是"给你张图,回答个问题",dots3-note 官方演示的却全是这类任务:协调一整套婚礼筹备、经营一家咖啡电商、当新西兰自驾游的全程管家。这些任务有三个共同点:跨天甚至跨周,用户一开始的需求很模糊、中途还会变,价格库存天气这些外部条件也在异步变化。
团队为这类任务专门做了两个 benchmark 并开源出来。VibeSearchBench 考的是"意图逐步披露"下的多轮搜索,Claude Opus 5 这样的头部模型也只拿到 31 分出头。VibeLifeBench 更狠,模拟真实时间线和服务环境变化,参评的 7 家头部模型全员不及格。知乎也就是说,这个方向目前是一条没人跑通的空白赛道,小红书押的就是它。底气来自一个叫 TEMPO 的长程任务训练方法:模型干活的同时自己当教练,在每个中间阶段评估自己的进度,官方给的数据是在 ARC-AGI-3 这类超长程任务上,比传统强化学习方法高出两三成。知乎

官方 demo 甚至让它连续打《杀戮尖塔 2》,一边打一边记录假设、从失败里学习。

这也解释了 IMO 满分:奥数题本质就是"提出猜想、验证、自查、纠错"的长程任务,正好踩在它的舒适区上。
社区实测为什么翻车这么狠
另一面的故事来自社区。
有 B 站 UP 主把它接进 DeepSeek 的测试框架跑了一轮极限测试:强约束生成直接掉进无限输出循环,同一句话重复上百遍,直到把 token 耗光。哔哩哔哩编程部分更是全面翻车——浏览器 OS 界面简陋、计算器异常、终端不工作、3D 赛车连车都画不出来。倒是 24 点、密码锁这类基础逻辑推理正常通过。
小红书上有用户实测后更失望:API 目前多模态能力还没开放,生图也不行。小红书不主动下指令它还会"偷懒",测试的数学题第一次错、第二次才对。
另一个 AI 六项能力实测视频的评论区更直接:“不是中断就是无限思考,一个问题拖半个小时”“API 超级无敌不稳定,经常思考完不输出”。哔哩哔哩还有 UP 主直接把疑问写进了视频标题:用小红书的数据训练出来的 agent,你敢用吗?哔哩哔哩但要注意的是,这些实测翻车的,几乎全是"通用聊天+编程",恰恰不是 dots3-note 选的主战场。就像拿越野车去赛道测圈速。不过它也说明一件事:作为通用多模态模型,这个 Preview 版的成熟度有限,别指望它现在替你在日常问答和写代码前线顶班。
算笔账:别下载,去用免费 API
接下来是跟"值不值"最相关的部分。
本地部署:基本可以死心。官方推荐方案是单机 8 张 H100、FP8 权重、TP=8 加 EP=8。知乎MoE 虽然只激活 16B,但 280B 的权重得整个装进去,这不是家用 24G、32G 显存能参与的游戏。
好消息在 API。登录 dots.ai 开放平台注册就能限时免费调用,兼容 OpenAI 和 Anthropic 双协议,改个 base URL 就能接进现有客户端。小红书OpenRouter 上也有它的身影,不过有用户注意到 free 标签一度消失过,想白嫖得抓紧。知乎时间点也巧:DeepSeek 涨价生效后,已经有人在找免费的开源替代,还有 UP 主直接把这写进了视频标题。哔哩哔哩具体免费期限官方没公布,先到先得,想试的别犹豫。
怎么用?去试长程任务。给它一个模糊需求,比如"规划一趟 10 天的关西秋季行程,预算 1.5 万,帮我盯机票价格随时调整",让它多轮连续跑,看它会不会丢状态、自查靠不靠谱。别拿它快问快答,也别让它写代码,那是拿它的短板碰别人的长板。
三类人,三个结论
Agent 和长任务玩家:现在就试。免费窗口期,加上目前独一份的长程任务训练,它是眼下少有的、专门冲着"真实生活长程任务"去的开源模型。重点观察多日任务里的状态保持和自我纠错。

本地部署党:先别碰。官方推荐方案就要 8 张 H100,对个人不现实。不过 dots3 系列后面还有 jazz 和 aria 两档,官方规划覆盖不同的任务复杂度、响应速度与计算成本。小红书要是后续开源更小的版本,机会可能就来了。
编程和日常问答党:别碰。多个实测已经证明这不是它擅长的方向。本地部署可以看看社区反复拿来对比的 Qwen3.8-27B,API 可以比比 Kimi K3 这类新旗舰,没必要为了免费硬上。
三个值得继续盯的信号
一是免费期结束后怎么收费、定价多少;二是无限循环、思考中断这些 bug,后续版本修不修(官方也承认这是预览版);三是 VibeLifeBench 会不会被其他团队采用——如果这个 benchmark 成了行业标尺,"长程任务"才算真正成为多模态竞赛的下半场。
小红书这一步走得未必漂亮,但方向值得盯:多模态"看懂图"的竞赛已经卷成红海,真正帮人把事办成的竞赛,才刚开始。