最近在养"马"的人应该发现了,Hermes 桌面版左侧栏"Sessions"旁边多了一个"Bots"标签页。Nous Research 的 Hermes Agent 本周正式上线了 Bot Mode(机器人模式),8 月 18 日的 v0.20.4 稳定版又把 SESSIONS|BOTS 双标签侧边栏和一组群聊修复合尾打包。GitHub社区对这个功能的第一反应不是"好棒",而是一个疑问:这和我多开几个会话有什么区别?这个问题值得认真回答,因为它决定了你怎么用这个功能,更决定了你的 token 账单接下来会怎么涨。
Bot Mode 到底是个啥
先看官方口径:Bot Mode 把你的 Hermes profiles 变成一队有名字的 Bot,每个 Bot 有自己的角色、模型、记忆、技能和头像。Hermes官方文档
这里的关键是:Bot 不是什么新概念,它就是一个 Hermes profile,桌面版只是给它做了可视化。有博主实测后的描述很准确:每个 Bot 也都是独立运行,有自己的记忆、技能、聊天记录,互不干扰。知乎

把文档里的机制拆开,大概是这几条:
每个 Bot 有专属的 SOUL.md 角色文件、专属记忆和技能,还有专属头像,默认按名字生成一张 Blob 脸,配了图像模型还能直接 AI 生成。
每个 Bot 出生就自带一个被置顶的主聊天,在里面输 /new 会被自动转成 /compact,只压缩上下文、不断掉这条关系线。
Routines 定时任务挂在干活的那个 Bot 名下,跑出来的结果直接落回它自己的聊天历史里。
群组支持 2 到 6 个 Bot:你的一条消息最多触发 3 轮接龙,每轮最多 10 条消息,整轮全员沉默就自动收敛,遇到拿不准的判断还能 @user 把难题甩回给你。
在任意聊天里 @某个 Bot 的名字,就能把任务交接过去。
每个 Bot 可以单独绑定模型,这条是全文最实用的一句话,后面算账要用。
会话 vs Bot:真不一样吗
赛博逐梦算是典型的 Hermes 重度用户:文章写作、系统中心、每日总结、A 股分析、各种产品研究,一个主题开一个会话,光常用的置顶会话就有 18 个。微博
所以看到 Bot Mode,他的第一反应和大多数人一样:这和我多开几个会话有什么区别?研究一圈后他给出的结论是:会话更适合把不同聊天主题分开,Bot 则更像一个长期岗位,可以单独积累记忆、配置技能和工具。微博
这个判断标准很实际:不是聊得越多越值得转,而是看"这个会话值不值得慢慢变成一个固定工作"。如果你每天都在同一个会话里重复同一类任务,每次还得重新交代背景、重新配置,那它就该变成一个 Bot。换句话说,Bot Mode 的本质是把使用 Hermes 的基本单位从"对话"升级成了"岗位"。
岗位之间怎么交接也想好了:在任意聊天里输入 @botname,当前 Bot 会把消息转交给目标 Bot,等对方回复后再把结果带回来汇报。Hermes官方文档

为什么评论区全在聊 token
多 Bot 协作听着上头,但问题很现实:Bot 之间每交互一次,都要带着完整上下文走一轮,接龙的轮数就是成本的乘数。
B站一条 Bot Mode 演示视频下面,评论几乎没人在讨论功能,全在算账。有人直言 token 扛不住,还有人问得更狠:你这是把四大银行绑到自动充值上了?哔哩哔哩
这种担心不是多余的。官方给群聊设了硬上限,一条消息最多触发 3 轮、每轮最多 10 条,文档里的原话是防止房间"转个不停"。Hermes官方文档翻译得更直白一点:防 room spinning,也是防你的余额 spinning。
harness 对成本的影响比多数人想象得大。Composio 做过一组基准:同一个模型、同一批任务,只换 agent harness,token 消耗最高能差 30 倍。微博
Nous 自己也在沿着这条路省。8 月中旬 Hermes 把 12 个浏览器工具合并成 1 个 browser_exec,官方实测完成同样的网页任务,token 消耗下降 48% 到 66%,准确率没有下降。知乎

现实背景让这笔账更真实。国产大模型调价之后,一位 7 万粉的博主说,平时想用 AGENT 干点事"总觉得束手束脚",他的第一反应是把 AGENT 里定期执行的任务全部迁到非高峰时段,减少不必要的 token 消耗。微博
他还顺手发现了 OpenRouter 上免费的 NVIDIA Nemotron 档位,对这次迁移的总结很直白:再便宜的东西也比不上免费的好。微博
这就是 2026 年的养马现状:功能免费(MIT 开源),token 不免费。
养马省账:开马场前先做四件事
好消息是,Bot Mode 的成本优化路径都是现成的。
①模型分层。判断岗(研究、写作、决策)用强模型,例行岗(每日总结、固定抓取、收件箱巡检)用便宜甚至免费的模型。官方文档直接给了这句:不同的 Bot 可以同时跑在不同模型上。<#&!53#&!>Hermes官方文档

②定时任务跑错峰。Routines 本质就是 cron 任务,把重活挪到低价或低峰时段,是上面那位博主验证过的第一招。
③部署方式算清楚。官方页面给了自部署路线,5 美元的 VPS、GPU 集群或者按需付费的 serverless 架构都行,数据在自己手里。Hermes官网Nous 也提供按月付费的云托管,融资报道里的口径大约是每月 20 到 200 美元。微博
④盯住 harness 层的差异。Composio 那个 30 倍的差距已经证明,同样的模型在不同框架下跑,成本完全不是一个量级;刚开源的 HarnessRouter 把这个思路又推进了一步,一套 API 之下,Codex、Claude Code、Hermes 随便换。微博
谁适合现在就开,谁建议再等等
已经有 3 个以上长期重复的同类会话:纯收益,今天就能迁。先把重复频率最高的两三个会话转成 Bot,体验提升是立竿见影的。
还把 Hermes 当聊天助手用:别急着开 Bot,会话分主题就够了,硬上岗位化只会增加管理成本。
对 token 敏感:先把模型分层和错峰定时任务搭好,再去碰多 Bot 群聊。群聊是乘数,得先把底数稳住。
还有两件事可以持续关注:Bot 的实时打断目前还是官方文档里的 future work。Hermes官方文档这一窗口的完整功能说明,会随 v0.21.0 的发版文档一起补齐。GitHub
写在最后
Hermes 现在的成绩单:GitHub star 已经超过 23 万。4 月它就已登顶 OpenRouter 编程榜。微博7 月 Nous Research 又以 15 亿美元估值敲定了至少 7500 万美元的新一轮融资。微博Bot Mode 把"养一匹马"变成了"养一群马",功能免费,马群的成本看你自己的账怎么算。