一句话摘要
用 Hermes 从低价 VPS 搭建智能体团队
如何用 Hermes 搭建一支 7×24 小时的 AI 智能体团队:从一台 $5 VPS 到五智能体流水线的 16 步
2026 年 7 月 17 日 · 16 分钟阅读 · 查看原文 ↗ AI 自动化 Claude 营销
大多数人只在一个聊天窗口里跑一个 AI 智能体,然后把它叫做"一套配置"。
Hermes 跑的是一支从不登出的团队:一个编排者加四个专家,每个都有各自的记忆、各自的灵魂文件、各自的 Telegram 机器人。而整套技术栈每月大约只要 $12:一台 $5 的服务器加一个 $7 的订阅。
把这篇文章收藏起来。这是完整路径:安装、模型、记忆、自我改进循环,以及多智能体编排。下面每一条命令和配置都是真的。
给怀疑者的背景:Hermes 是 Nous Research 的开源云端智能体,社区追踪器显示它在头两个月内就达到约 16 万 GitHub star,是该平台历史上攀升最快的项目之一。与聊天标签页不同,它跨会话保持记忆,并在你工作的同时升级自己的技能库。最后这一点才是值得在意的理由。
> 收藏本文。关注 @0xGenAi
你会得到:最便宜的可用大脑配置、带令牌上限的精确记忆架构、自我改进循环到底如何触发、技能建设的纪律,以及从单一智能体到一支团队的 10 条提示词路径。
第 1 部分:把它跑起来
01. 一条命令安装。一个 $5 的盒子安身。
本地安装可行(一条命令,文件落到 ~/.hermes),但云端智能体的意义在于:你的笔记本合上了,智能体还在跑。一台 $5 的 Hetzner 或 Contabo VPS 就够。
# Linux / macOS / WSL / 你的 VPS:
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
# Windows (PowerShell):
iex (irm https://hermes-agent.nousresearch.com/install.ps1)
# 然后:
hermes setup # 引导式 TUI:模型、终端后端、网关、工具
终端后端:Local 是默认选项,个人使用足够;一个内置的审批系统会拦截破坏性命令(rm -rf、DROP TABLE)并先询问。Docker、SSH、Modal 和 Daytona 用于不受信任的代码和团队规模。先从 Local 开始,以后再升级。
02. 免费大脑阶梯。在掏钱之前把一切都试一遍。
有四种经过记录的免费跑 Hermes 的方式,按实际可用性排名:
免费阶梯(截至 2026 年 7 月中旬):
1. Nous Portal 订阅 -> Stepfun 3.7 Flash,通过 portal 登录免费。
hermes model -> Nous Portal -> Connect。目前最好的免费选项。
2. NVIDIA NIM -> 邮箱 + 手机注册,免费端点。
筛选:Free Endpoint + Most Popular。GLM 5.1、MiniMax M2.7。
hermes model -> NVIDIA NIM -> 粘贴密钥 -> 不填 URL -> 选模型。
注意:响应明显更慢。
3. Ollama Cloud 免费 -> 在 VPS 上安装 ollama,连接账号。
Gemma 4(31B,带视觉)连接没问题。额度适中。
4. OpenRouter 免费标签 -> 只有 OVL Alpha 和 Nemotron 3 Super
稳定。免费的 Kimi 2.6 列表大多会报错。自定义模型名
经常返回"model overloaded"(模型过载)。
这四种方式的共同规律:免费层级是用来学习工具的,不是用来跑生产的。而这正是下一步的用途。
03. $7 的技巧和 $10 的主力。团队真正跑在这里。
两个经社区验证的预算配置,在"每个有用令牌的价格"上打败其他一切:
付费但便宜:
ChatGPT Go($7/月)-> Codex 额度在 Hermes 内生效。
ChatGPT 设置 -> Security -> 为 Codex 启用设备码认证。
hermes model -> OpenAI Codex -> 打开链接 -> 设备码 -> 选模型。
社区实测:Go 没有 5 小时上限,一个月度上限(每月 1 日重置)。
OpenCode Go($10/月,首月常为 $5)-> 开源模型:
Qwen 3.7 Max、MiniMax 2.7(额度很大)、DeepSeek 4 Pro/Flash。
hermes model -> OpenCode Go -> API key -> 回车跳过 base URL -> 选模型。
Ollama Pro($20/月)-> 升级路径:三个云端模型
并行运行,一旦你在第 3 部分搭起团队,这一点就重要了。
一个从 OpenRouter 世界带来的值得保留的习惯:每个智能体一个独立 API key,创建时设定月度额度上限。你能精确看到每个智能体花多少,而失控循环会撞上你自己选的那堵墙。
04. 把后台任务路由到便宜模型。这是没人碰的配置。
Hermes 把对话模型和辅助模型分开。七个后台任务各自接受自己的供应商:vision、web_extract、compression、title_generation、curator、kanban_decomposer、goal_judge。把它们全留在主模型上,意味着为生成会话标题支付旗舰级费用。
# config.yaml
model:
provider: "openai-codex"
default: "gpt-5.4-mini" # 主对话
auxiliary:
compression: # 上下文压缩:便宜且频繁
provider: "opencode"
model: "minimax-2.7"
title_generation:
provider: "opencode"
model: "deepseek-4-flash"
vision:
provider: "ollama"
model: "gemma4" # 免费,带视觉
curator: # 小心:这个模型的决策会复利。
provider: "openai-codex" # 用强模型
model: "gpt-5.4-mini"
两个来源都给的同一条警告:别在 curator 模型上省钱。它的判断会改写你的技能库(第 2 部分),而一次糟糕的合并,代价远超你省下的那些令牌。
直接指定供应商路由还解决了一个真实的 OpenRouter 问题:同一个名义模型由约 20 个供应商以不同量化精度提供服务,每次请求都被静默轮换。手动路由意味着每个任务一个一致的模型。
05. Telegram 网关。三条命令加两个机器人的配置量。
1. @BotFather -> /newbot -> 起名 -> 用户名以 "bot" 结尾
-> 复制机器人令牌
2. @userinfobot -> Start -> 复制你的数字用户 ID
(把智能体锁定到你本人;其他人无法连接)
3. 终端:
hermes gtw setup # 选 Telegram,粘贴令牌,粘贴用户 ID
hermes gtw install
hermes gtw start
从这里起,智能体就住在你的口袋里。现在还出了一个桌面应用(技能、网关、记忆和配置文件可视化管理,与你的 VPS 同步),它消除了最后一个"只能用终端"的借口。
06. 学会六个斜杠命令和两个自动化原语。跳过另外四十个。
Hermes 内置几十个斜杠命令。这些才是能改变你工作方式的:
/background <prompt> -> 运行一个任务而不阻塞你的会话
/goal -> 一个智能体持续为之努力的持久目标;
暂停 / 恢复 / 状态。一个独立的 goal_judge
智能体会核实它是否真的完成
/spike -> 在真正开发之前快速做一次抛掷式实验
/dogfood -> QA 模式:在一个 Web 应用里猎虫,返回一份
有证据支撑的报告
/systematic_debugging -> 四个阶段,任何修复之前先找到根因
/claude_code、/codex -> 直接委派编码给这些 CLI 工具,
省下你的对话模型令牌
聊天之外的两个原语:cron 作业(带 -no-agent,一个排期脚本运行并把输出转发到 Telegram,零 LLM 令牌消耗)和 webhook——更强的一个:一个外部事件用一个预设提示词和技能集触发一个智能体。一个新 GitHub PR 触发一个值班审查智能体,就是经典例子。
第 2 部分:记忆与循环
07. SOUL.md 是主提示词。写一次,写得紧。
SOUL.md 永久驻留在上下文里:它是智能体是谁,而不是它今天在做什么。一个智能体,一个灵魂。一个可用的开发者智能体模板:
# SOUL.md
你是一名经验丰富的资深软件工程师。
回答简短、精确,没有废话,没有显而易见的解释。
提出实用方案,在合适时交付可运行的代码。
始终考虑边界情况、错误、安全、性能、规模。
如果有更好的方法,提出来,并用一行说明原因。
具体例子和数字优先于抽象。
绝不虚构事实、API 或能力。信息不足:问。
复杂任务:先出简短计划,再实施。
用用户的语言回复。
运行时人格预设(Teacher、Philosopher、Noir 等等)在上面叠加一层会话人格,但 SOUL.md 在冲突时永远胜出。灵魂是身份;人格是戏服。
08. 在信任记忆之前,先了解它的上限。
内置记忆是两个 markdown 文件加一个会话数据库,而且大小是公开的、很小的:
内置记忆:
memory.md -> 会话事实,约 800 令牌上限。
溢出时逐出最旧的条目。
user.md -> 关于你的事实,约 500 令牌上限。
state.db -> 每一次聊天,可通过 recall 搜索。这就是为什么
一个从 user.md 被抹掉的事实仍能被记住。
令牌现实:一句光秃秃的 "hi" 就已经带着 15-17K 令牌的上下文
(记忆文件、系统提示、技能描述、工具)。
每结束一个话题,用 `new` 重置会话窗口。
这些上限正是使用外部记忆的理由。两条来自实践的规则:一开始就选好一个引擎(以后把 Holographic 迁到 Honcho 很痛苦),并按负载来选。Holographic 是一个免费的本地 SQLite 存储,带信任评分和矛盾检测:适合个人使用。Honcho 通过后台 LLM 调用构建分层用户画像,而且现在注册一张卡送 $100 额度,以个人聊天的量能用好几年。更重的选项(Hindsight 的知识图谱、Mem0 的托管云、面向团队的 RetainDB)在工作流超出前两者时才需要。
09. 选你的上下文引擎:便宜的摘要,还是无损的地图。
当一段对话逼近令牌上限时,上下文引擎决定什么能存活。有两种,而且它们的失败方式不同:
Compressor(默认)-> 对对话中间部分做有损摘要。
快、便宜,但细节会悄然消失。
适合:独立任务、短工作流。
LCM(Lossless Context Management,无损上下文管理)-> 不做文本摘要。构建一张
对话关键点的有向图;智能体从压缩视图
导航到其背后确切的原始消息。
适合:长会话,其中第 12 轮的一个细节
决定第 80 轮。
如果你曾遇到过一个智能体自信地忘掉你一小时前说过的约束,这个设置正是修复那类失败的所在。
10. 自我改进循环:两个计数器,一个后台智能体。
这是把 Hermes 和 OpenClaw 一类智能体区分开的功能,而且它是机械的,不是魔法。没有任何东西分析每条消息;两个计数器把关着这项工作:
触发系统:
memory 触发 -> 每 10 条用户提示触发一次。
问题:有没有出现值得保存的新事实?
skill 触发 -> 单轮内每 10 次工具调用迭代触发一次。
逻辑:如果智能体刚刚为一个问题搏斗了 10 步,
那段经验或许值得编译成一个技能。
触发时 -> 一份会话快照进入一个隔离的后台
审查智能体。它把事实写入 memory.md / user.md,并可以
创建、修补或删除技能。每个自创技能都被打上
agent-generated 标签,带一个隐藏的使用日志:加载、读取、编辑、
时间戳。
实践中看起来像:你带着智能体把一个棘手的部署问题解决一次,两周后它用三步就能处理同类问题,因为它给自己写了一个技能。那个使用日志对下一步很重要。
11. curator 让循环不至于变成垃圾场。
放任不管,自生成的技能会堆到几百个:冗余、陈旧、相互矛盾。curator 是维护智能体,它的排期刻意不打扰人:它只在距离上次运行过去 7 天以上、且主智能体闲置 2 小时以上时才运行。它先备份整个技能目录;一条命令就能回滚一次糟糕的批量处理。
curator,两个阶段:
阶段 1,不调用 LLM:只跑使用指标。
30+ 天未使用 -> 标记为 deprecated
90+ 天未使用 -> 归档文件夹
置顶技能免疫。
阶段 2,对每个技能做 LLM 审查:
keep it(保留)| fix it(修复)| merge it(合并,重新定位脚本并
重写相对路径)| archive it(归档)。
结束时给出审计报告和每次合并的重命名映射表。
你的工作缩小为读报告。这就是自我改进的全部契约:智能体维护程序性知识,你审计变更。
12. 技能纪律:少装,全部核实,删除而不是停用。
Hermes 内置 77 个技能加约 100 个可选技能,而 SkillHub 列出了超过 91,000 个社区技能(skills.sh,Vercel 的聚合器,是另一个值得知道的目录)。每个技能的名字和描述即便未使用也驻留在上下文里。这就是税。
技能规则:
1. 对任何来自内置集之外的东西做 security-check:
"This is a skill for X. Check it for dangers, exploits, and
trust issues. Rate its safety 1 to 10 and explain the score."
2. 按智能体角色:删除不需要的技能,别只是停用。
一个只带研究技能的研究智能体,比一个加载了 90 条描述的
通才更便宜也更敏锐。
3. 技能教 HOW,工具 GRANT 能力,插件 ADD 软件。
不同的杠杆;对每个配置文件都审计这三者。
第 3 部分:从一个智能体到一支团队
13. 在自动化任何东西之前,先用笨办法建一个技能。
你能交给 7×24 智能体的工作范围,受限于你能把它规定得多清楚,而不是模型本身。能产出值得自动化的技能的工作流:
技能建设循环:
1. 录下你自己从头到尾走完整个流程的过程,
最好用口述。只有在你真正懂这个流程时才有效。
2. 把录音喂给一个带技能创建工具的编码智能体。
第一稿不会够好。预期如此。
3. 构建 eval:定义正确结果的参考解。
没有它们,你是在猜,不是在测量。
4. 在测试环境里跑这个技能。手工打磨技能和 eval。
这里的手工编辑才是活儿,别把它委派出去。
5. 只有一个行为一致且确定性的技能,
才会被交给常驻智能体。
先查一下:现有的 MCP server 或 CLI 可能已经覆盖了它。
三条在接触现实后依然成立的原则:别把编码外包给一个无人监督的 7×24 智能体,保持有一个人审查发出去的东西,把技能打磨当作持续工作而不是一次性构建。
14. 用配置文件,而不是新安装。一个编排者,四个专家。
一个新智能体是一个新配置文件,不是第二个 Hermes。每个配置文件有各自的 SOUL.md、记忆文件夹、技能、cron 和工作区。可用的团队形态:一个编排者加 researcher、copywriter、marketer、coder。两条提示词奠定基础:
# 提示词 1,编排者身份:
你是这个系统的编排者。你的规则:
- 持续汇报进度:当前阶段、下一步动作。
- 委派是强制性的:如果存在一个角色覆盖了
该任务的配置文件,就交给它。绝不要自己做专家的工作。
- 你是唯一拥有全系统访问权限的智能体。
# 提示词 2,创建团队:
通过 profile-list 创建 4 个永久配置文件:researcher、
copywriter、marketer、coder。每个都有:自己的 SOUL.md,带一个
稳定身份;一个隔离的工作区;以及按角色划分的记忆。
15. 隔离与路由。这一步决定这事成不成。
跳过隔离就会产生经典失败:编排者抢了 coder 的任务,copywriter 在写 Python。再多一条提示词,而它是重要的一条:
# 提示词 3,隔离:
隔离每一个配置文件:每个身份只履行自己的角色。
工作目录分开,每个配置文件的记忆分开
(每个配置文件的 memory.md 和 user.md 只反映其角色)。
逐个配置文件确认记忆如何绑定。列出你采取的步骤。
然后接好路由,让团队可被调用:每个配置文件一个斜杠命令(/researcher、/copywriter、/marketer、/coder),做一遍共享认知,让每个智能体都知道其他智能体的存在以及谁是这个系统的所有者,可选地通过 BotFather 给每个配置文件开一个独立 Telegram 机器人,每个智能体硬绑定到自己的机器人 ID、不能是别人的。免费 Telegram 账号上限 20 个机器人;那够用了。
16. 流水线、日志,以及让它存活的习惯。
收尾的一步。教编排者一个复合命令:
# 提示词 4,流水线:
添加命令:对 <topic> 跑完整流水线。
流程:researcher 收集来源和用例 -> copywriter 把研究
变成一篇长文初稿 -> marketer 产出社媒帖子、
推广策略和分发计划。你拆分工作,
在配置文件之间传递产物,并在每次交接时汇报。
对"独立创作者的自动化点子"这个话题,一次有记录地跑这个流程,用一条命令就返回了收集到的用例、一篇完成的文章、8 条社媒帖子和一份推广计划。那次运行得出的诚实结论适用于一切:它最适合作为一种有人审查输出的可重复惯例,而不是"AI 独自搞定一切"。
用一个日志环节收尾(每个智能体把动作汇报进一个编排者拥有的共享数据库,外加每月日志留存),以及三条习惯:每个话题结束后 new,后台任务固定到便宜模型,每个配置文件定期清理技能。
常见错误
把整支团队跑在对话模型上。七个辅助任务接受便宜路由;账单差异就是整个预算。
具体在 curator 模型上省钱。它的合并决策会复利进你的技能库。
随意选记忆引擎。从 Holographic 迁到 Honcho 是有记录的痛苦;只选一次。
像装浏览器扩展一样装技能。每条描述都是每条消息的上下文税。
在专家配置文件上停用而不是删除技能。税还在。
把一个半测试的技能交给常驻智能体。如果它在测试环境里不具确定性,它就不够格跑 7×24。
跳过隔离提示词,然后去调试为什么 copywriter 在跑构建。
把无人监督的编码外包给 7×24 云端智能体。两个来源指南都独立地把这标记为你唯一不该那么做的例外。
忘记 new。一句 "hi" 已经花掉 15-17K 上下文令牌;一个一周前的会话花得远多于此。
链接
核心:Hermes 安装与文档:hermes-agent.nousresearch.com · Nous Research:nousresearch.com
服务器:Hetzner:hetzner.com · Contabo:contabo.com
模型供应商:Ollama:ollama.com · NVIDIA NIM:build.nvidia.com · OpenRouter:openrouter.ai · OpenCode:opencode.ai · ChatGPT(Codex 设备认证):chatgpt.com
终端后端:Modal:modal.com · Daytona:daytona.io
记忆引擎:Honcho:honcho.dev(有专门的 Hermes 集成指南)· Mem0:mem0.ai
技能目录:skills.sh
Telegram:t.me/BotFather · t.me/userinfobot
诚实真相
$12 这个数字是底线,不是承诺:它假设 ChatGPT Go 的额度装得下你的用量,而社区实测的额度是非官方的、会不另行通知地变化。免费层级会降级或消失(Nous 上那个免费 Kimi 窗口只持续了三周)。自我改进循环是真的,但也是受限的:它从你自己的会话里编译程序性捷径,它不会让基础模型更聪明。多智能体配置文件会倍增记忆文件和技能集,也就倍增了你刚刚学会控制的令牌开销:一个跑在免费模型层级上的五智能体编排会饿死。而且这里描述的一切是 2026 年 7 月中旬的 Hermes;这个品类以 3 到 6 个月的趋势周期移动,今天赢的那套配置会被下一个版本重写。
结论
在 Telegram 里应答的智能体是演示。真正的转变是配置的单元:你不是在配置一个聊天机器人,你是在为一个系统配员。灵魂代替提示词,配置文件代替标签页,一个 curator 代替你自己的家政。
这套栈花的钱比一顿午饭还少。纪律才是真正的价格。
把工作委派出去。把审查留给自己。
租下那台机器,跑一遍安装命令,今晚就给第一个智能体它的灵魂。
收藏本文。关注 @0xGenAi
标签:# X # AI # Automation # Claude # Marketing # Guide # Chatgpt # Hermes
相关文章 How to design an AI agent
谁他妈愿意为你的平台付费,当 $200 已经能买下 Claude Max 或 Codex?AI Claude Marketing Automation
原文参考:https://maxed.wiki/posts/how-to-build-a-24-7-ai-agent-team-with-hermes-16-steps-from-a-5-vps-to-a-five-agent-pipeline/ (Maxed.wiki,本页为站内中文整理)