Hermes 发布 Bot Mode:“养马”正式进入马群时代,但开马场前得先算算 token 这笔账

源自13位全网作者

22:14

最近在养"马"的人应该发现了,Hermes 桌面版左侧栏"Sessions"旁边多了一个"Bots"标签页。Nous Research 的 Hermes Agent 本周正式上线了 Bot Mode(机器人模式),8 月 18 日的 v0.20.4 稳定版又把 SESSIONS|BOTS 双标签侧边栏和一组群聊修复合尾打包。GitHub社区对这个功能的第一反应不是"好棒",而是一个疑问:这和我多开几个会话有什么区别?这个问题值得认真回答,因为它决定了你怎么用这个功能,更决定了你的 token 账单接下来会怎么涨。

Bot Mode 到底是个啥

先看官方口径:Bot Mode 把你的 Hermes profiles 变成一队有名字的 Bot,每个 Bot 有自己的角色、模型、记忆、技能和头像。Hermes官方文档

这里的关键是:Bot 不是什么新概念,它就是一个 Hermes profile,桌面版只是给它做了可视化。有博主实测后的描述很准确:每个 Bot 也都是独立运行,有自己的记忆、技能、聊天记录,互不干扰。知乎

Hermes 发布 Bot Mode:“养马”正式进入马群时代,但开马场前得先算算 token 这笔账

把文档里的机制拆开,大概是这几条:

  • 每个 Bot 有专属的 SOUL.md 角色文件、专属记忆和技能,还有专属头像,默认按名字生成一张 Blob 脸,配了图像模型还能直接 AI 生成。

  • 每个 Bot 出生就自带一个被置顶的主聊天,在里面输 /new 会被自动转成 /compact,只压缩上下文、不断掉这条关系线。

  • Routines 定时任务挂在干活的那个 Bot 名下,跑出来的结果直接落回它自己的聊天历史里。

  • 群组支持 2 到 6 个 Bot:你的一条消息最多触发 3 轮接龙,每轮最多 10 条消息,整轮全员沉默就自动收敛,遇到拿不准的判断还能 @user 把难题甩回给你。

  • 在任意聊天里 @某个 Bot 的名字,就能把任务交接过去。

  • 每个 Bot 可以单独绑定模型,这条是全文最实用的一句话,后面算账要用。

会话 vs Bot:真不一样吗

赛博逐梦算是典型的 Hermes 重度用户:文章写作、系统中心、每日总结、A 股分析、各种产品研究,一个主题开一个会话,光常用的置顶会话就有 18 个。微博

所以看到 Bot Mode,他的第一反应和大多数人一样:这和我多开几个会话有什么区别?研究一圈后他给出的结论是:会话更适合把不同聊天主题分开,Bot 则更像一个长期岗位,可以单独积累记忆、配置技能和工具。微博

这个判断标准很实际:不是聊得越多越值得转,而是看"这个会话值不值得慢慢变成一个固定工作"。如果你每天都在同一个会话里重复同一类任务,每次还得重新交代背景、重新配置,那它就该变成一个 Bot。换句话说,Bot Mode 的本质是把使用 Hermes 的基本单位从"对话"升级成了"岗位"。

岗位之间怎么交接也想好了:在任意聊天里输入 @botname,当前 Bot 会把消息转交给目标 Bot,等对方回复后再把结果带回来汇报。Hermes官方文档

Hermes 发布 Bot Mode:“养马”正式进入马群时代,但开马场前得先算算 token 这笔账

为什么评论区全在聊 token

多 Bot 协作听着上头,但问题很现实:Bot 之间每交互一次,都要带着完整上下文走一轮,接龙的轮数就是成本的乘数。

B站一条 Bot Mode 演示视频下面,评论几乎没人在讨论功能,全在算账。有人直言 token 扛不住,还有人问得更狠:你这是把四大银行绑到自动充值上了?哔哩哔哩

这种担心不是多余的。官方给群聊设了硬上限,一条消息最多触发 3 轮、每轮最多 10 条,文档里的原话是防止房间"转个不停"。Hermes官方文档翻译得更直白一点:防 room spinning,也是防你的余额 spinning。

harness 对成本的影响比多数人想象得大。Composio 做过一组基准:同一个模型、同一批任务,只换 agent harness,token 消耗最高能差 30 倍。微博

Nous 自己也在沿着这条路省。8 月中旬 Hermes 把 12 个浏览器工具合并成 1 个 browser_exec,官方实测完成同样的网页任务,token 消耗下降 48% 到 66%,准确率没有下降。知乎

Hermes 发布 Bot Mode:“养马”正式进入马群时代,但开马场前得先算算 token 这笔账

现实背景让这笔账更真实。国产大模型调价之后,一位 7 万粉的博主说,平时想用 AGENT 干点事"总觉得束手束脚",他的第一反应是把 AGENT 里定期执行的任务全部迁到非高峰时段,减少不必要的 token 消耗。微博

他还顺手发现了 OpenRouter 上免费的 NVIDIA Nemotron 档位,对这次迁移的总结很直白:再便宜的东西也比不上免费的好。微博

这就是 2026 年的养马现状:功能免费(MIT 开源),token 不免费。

养马省账:开马场前先做四件事

好消息是,Bot Mode 的成本优化路径都是现成的。

①模型分层。判断岗(研究、写作、决策)用强模型,例行岗(每日总结、固定抓取、收件箱巡检)用便宜甚至免费的模型。官方文档直接给了这句:不同的 Bot 可以同时跑在不同模型上。<#&!53#&!>Hermes官方文档

Hermes 发布 Bot Mode:“养马”正式进入马群时代,但开马场前得先算算 token 这笔账

②定时任务跑错峰。Routines 本质就是 cron 任务,把重活挪到低价或低峰时段,是上面那位博主验证过的第一招。

③部署方式算清楚。官方页面给了自部署路线,5 美元的 VPS、GPU 集群或者按需付费的 serverless 架构都行,数据在自己手里。Hermes官网Nous 也提供按月付费的云托管,融资报道里的口径大约是每月 20 到 200 美元。微博

④盯住 harness 层的差异。Composio 那个 30 倍的差距已经证明,同样的模型在不同框架下跑,成本完全不是一个量级;刚开源的 HarnessRouter 把这个思路又推进了一步,一套 API 之下,Codex、Claude Code、Hermes 随便换。微博

谁适合现在就开,谁建议再等等

  • 已经有 3 个以上长期重复的同类会话:纯收益,今天就能迁。先把重复频率最高的两三个会话转成 Bot,体验提升是立竿见影的。

  • 还把 Hermes 当聊天助手用:别急着开 Bot,会话分主题就够了,硬上岗位化只会增加管理成本。

  • 对 token 敏感:先把模型分层和错峰定时任务搭好,再去碰多 Bot 群聊。群聊是乘数,得先把底数稳住。

还有两件事可以持续关注:Bot 的实时打断目前还是官方文档里的 future work。Hermes官方文档这一窗口的完整功能说明,会随 v0.21.0 的发版文档一起补齐。GitHub

写在最后

Hermes 现在的成绩单:GitHub star 已经超过 23 万。4 月它就已登顶 OpenRouter 编程榜。微博7 月 Nous Research 又以 15 亿美元估值敲定了至少 7500 万美元的新一轮融资。微博Bot Mode 把"养一匹马"变成了"养一群马",功能免费,马群的成本看你自己的账怎么算。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章